{"as_of":"2026-08-10T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9a2b91b66fb24363a1366819364d5badb921c3360374ee1a0c4743d9b50267e","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:28.526144Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:18.763963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-07T00:40:18.763963Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-09T08:48:01.044046Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.763963Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:08dce6401eff6c36e35c355ce58ea79c65dfa508417628444ef09bf11f48fba6","observation_id":"52deed96-16d2-4713-8ddf-670d7841766c","resolution":{"observed_at":"2026-08-07T00:40:18.763963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2603.15432","last_updated":"2026-04-08T15:52:59Z","snapshot_observed_at":"2026-07-31T12:22:36.137299Z","submitted_at":"2026-03-16T15:37:07Z","title":"Gym-V: A Unified Vision Environment System for Agentic Vision Research","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T10:05:09.049846Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2603.15432"},"observation_digest":"sha256:f0638ea996ffbc65d2020810253bc0da49887abea4183a78281e6c7aca1116f2","observation_id":"6602a8c0-ded7-4e60-9cf4-681632ada537","resolution":{"observed_at":"2026-05-15T10:05:26.013264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":1},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:24.844859Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:a7f2738784c459243eec44b4acf78155447fbb872b899f7d5648ab2bcbcd6bc3","observation_id":"a1f9b627-e9ce-4eb9-a724-5371fd7d8615","resolution":{"observed_at":"2026-05-12T03:26:18.956227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":2},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:28.552513Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:9e27a96e28c3bec76d2c4fb007b14f339d16e8fddebf8ae743a41399042c773c","observation_id":"1ada96b7-545f-4cda-8013-94ce66bfc700","resolution":{"observed_at":"2026-05-13T06:47:27.208171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2606.06556","last_updated":"2026-06-04T10:43:14Z","snapshot_observed_at":"2026-08-09T06:57:25.072034Z","submitted_at":"2026-06-04T10:43:14Z","title":"Robots Need More than VLA and World Models","version":1},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-06-28T01:01:33.530167Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2606.06556"},"observation_digest":"sha256:2a9ad656673aa6552f99c18d58ed448339e99304835687733737098898c68028","observation_id":"9f936eca-af66-4500-87bd-e628d5435e1a","resolution":{"observed_at":"2026-06-28T01:11:28.829702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14552/citation-record","integrity":"/paper/2505.14552/integrity","json":"/paper/2505.14552/citation-record.json","paper":"/paper/2505.14552"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:32.228760Z","title":"Claude 3.7 sonnet and claude code, 2025","venue":null,"work_id":"3e9fc013-4e7a-453c-83a2-b4aee4c4fa84","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.696005Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:b290a44745b5848b06772cae7cca127a5a4ddc878519fa466cd2c778ad0711f6","observation_id":"06c09267-6863-4d3b-8544-98c54de1ae9f","resolution":{"observed_at":"2026-08-07T15:36:32.291040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:36:24.766524Z","title":"Qwen2.5-VL Technical Report.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.766524Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:93277e42ceaf8bd8d268c82fc4de35421f28a9ee1d047e34cfbde8078ea596d8","observation_id":"61e04e27-7bf6-441f-b331-05f09af5c82d","resolution":{"observed_at":"2026-08-07T15:36:24.766524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:32.098486Z","title":"Zebralogic: Benchmarking the logical reasoning ability of language models, 2024","venue":null,"work_id":"e0f9d00e-1c29-4c86-aecd-476705418b26","year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.858267Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:03f186b14a1c8cd68561c07979355b0760de0fc9aff7aafa47aeaf5707d9a9a5","observation_id":"c64c4f69-41e4-401f-935c-8912f3b7b554","resolution":{"observed_at":"2026-08-07T15:36:32.146472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.938274Z","title":"Doubao-vision-pro, 2025","venue":null,"work_id":"60c1cf4e-824a-4af3-abfd-d855f5fbdf30","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.927082Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:6474c5533f52e5a497228a6760adb9c408b13e8659787742317eadaeefa5fc61","observation_id":"eaadc71c-d655-42f7-8ec6-644812052813","resolution":{"observed_at":"2026-08-07T15:36:32.015367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.811362Z","title":"Doubao-1.5-pro, 2025","venue":null,"work_id":"5255b1b1-7659-40fd-978d-9617adf11e94","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.998909Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:f830a11fc38fe7661c435cc725499ae17ff725bf8ac34b3847ee4db8eb56d276","observation_id":"f96d137d-5105-470f-ad19-d8208f3356dc","resolution":{"observed_at":"2026-08-07T15:36:31.864759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-08T11:00:02.521037Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-07T15:36:25.068363Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks.CoRR, abs/2306.13831, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.068363Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:6e02b933248c2ec903b48a987599f6bb856ce060304e2113a6c5bd5edbc5b9f4","observation_id":"fbd77ceb-c0ea-462a-ae9a-d395ec67d38b","resolution":{"observed_at":"2026-08-07T15:36:25.068363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:36:25.162239Z","title":"Training Verifiers to Solve Math Word Problems.arXiv e-prints, art","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.162239Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:b43722083e32599424192c79415fed4f16a77131608527d86cb335cc6a305850","observation_id":"17adf4fc-e5df-48e1-ac42-aeed1cc19043","resolution":{"observed_at":"2026-08-07T15:36:25.162239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:25.216548Z","title":"Gemini 2.0 flash thinking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.216548Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:724576f38f9590be4f2c44c50c4ab97ca9ca33b2770708b69302f7a1b83c7dcc","observation_id":"49362b4f-08bb-4ecd-b761-3dc80b57eabf","resolution":{"observed_at":"2026-08-07T15:36:25.216548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.686894Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":"4baa1953-5e19-4ba5-b5da-1a159556b7bf","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.283477Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:581d7cb5999a9a9499323cb9ea460caa3a62a607099f203b31a50fe98f070ec4","observation_id":"1a648bd7-c1a6-4b6f-a4b4-a48de7bcbcda","resolution":{"observed_at":"2026-08-07T15:36:31.742211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:25.364222Z","title":"Mindagent: Emergent gaming interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.364222Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:70813af46e4645ef94db8dc0a941abe494c68fbccbb0e7ddeea858df2a1ca62e","observation_id":"c22364c2-623d-4fdc-822a-8d8265aac8c3","resolution":{"observed_at":"2026-08-07T15:36:25.364222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11442","last_updated":"2025-05-24T04:10:59Z","snapshot_observed_at":"2026-08-09T08:46:52.215556Z","submitted_at":"2025-04-15T17:55:20Z","title":"TextArena","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11442","snapshot_observed_at":"2026-08-07T15:36:25.443878Z","title":"TextArena.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.443878Z"},"links":{"cited_paper":"/paper/2504.11442","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:98a2f5bcd808531f7d17c4c3969aba52285c184c02e760a57f1091863aa38d2d","observation_id":"c67f13ed-8412-40c1-b8d3-c0218c6f8d43","resolution":{"observed_at":"2026-08-07T15:36:25.443878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15778","last_updated":"2024-10-12T11:00:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:16:41Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15778","snapshot_observed_at":"2026-08-07T15:36:25.488705Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.488705Z"},"links":{"cited_paper":"/paper/2408.15778","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:1fa3016825636651a777f492fc4f08c6864e25092a346cbecc02ad6cd9da58d8","observation_id":"785a96bc-8fa0-4272-9202-7e439a8276d6","resolution":{"observed_at":"2026-08-07T15:36:25.488705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:36:25.576192Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.576192Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:6222cd96d74870aa8ba7bf0d38732b823b26cc2d23b972566883eba1309ad212","observation_id":"5ca8f435-fefc-481e-b4f0-01eef8010bd0","resolution":{"observed_at":"2026-08-07T15:36:25.576192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00840","last_updated":"2024-10-11T20:08:54Z","snapshot_observed_at":"2026-08-09T17:25:13.891240Z","submitted_at":"2022-09-02T06:50:11Z","title":"FOLIO: Natural Language Reasoning with First-Order Logic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00840","snapshot_observed_at":"2026-08-07T15:36:25.653305Z","title":"Fabbri, Wojciech Kryscinski, Semih Yavuz, Ye Liu, Xi Victoria Lin, Shafiq Joty, Yingbo Zhou, Caiming Xiong, Rex Ying, Arman Cohan, and Dragomir Radev","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.653305Z"},"links":{"cited_paper":"/paper/2209.00840","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:3ee3fab7289218b51d2570e213b149289e37871c4879d0adf28272d5e97b1efa","observation_id":"e21f3090-69cb-4441-a937-26476f5fd925","resolution":{"observed_at":"2026-08-07T15:36:25.653305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:36:25.695051Z","title":"Measuring Massive Multitask Language Understanding.arXiv e-prints, art","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.695051Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:9bb605f0b67ed38ff9f927f950896047f4253be1115a1c87835320d5f4a9f301","observation_id":"4c3de423-2abd-4354-bf75-731cd35682be","resolution":{"observed_at":"2026-08-07T15:36:25.695051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:36:25.744056Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.744056Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:8d603ff34a2be23565054431d0746b485260f2fb9969a3e2ac379b8af18b608c","observation_id":"d60a46b2-91a1-4466-9e60-646f77eb5b94","resolution":{"observed_at":"2026-08-07T15:36:25.744056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06394","last_updated":"2025-02-15T22:03:16Z","snapshot_observed_at":"2026-08-06T14:14:54.915113Z","submitted_at":"2024-12-09T11:22:59Z","title":"GameArena: Evaluating LLM Reasoning through Live Computer Games","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06394","snapshot_observed_at":"2026-08-07T15:36:25.847549Z","title":"GameArena: Evaluating LLM Reasoning through Live Computer Games.arXiv e-prints, art","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.847549Z"},"links":{"cited_paper":"/paper/2412.06394","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:abe9186384087ce89442b422b8ae6db4583250138b4022efbdfd0ab7adb47058","observation_id":"30692c77-ddd6-4436-9a51-59b1f45ce31e","resolution":{"observed_at":"2026-08-07T15:36:25.847549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T15:36:25.898399Z","title":"Avalonbench: Evaluating llms playing the game of avalon","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.898399Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:9765bdb5ff9f3d1e448f2c95b49be9317641da3add18be75a5aecd2df26b34ff","observation_id":"34943d93-bde3-4456-a1e2-d32ed692a665","resolution":{"observed_at":"2026-08-07T15:36:25.898399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:36:25.931357Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.931357Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:adf66d50f2c003e64fd222a22d8d04485195e93706fef84ec2547334de1d6bed","observation_id":"52ff72c7-029b-4f1e-9a56-b601b1d725b7","resolution":{"observed_at":"2026-08-07T15:36:25.931357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-07T15:36:25.977121Z","title":"AgentBench: Evaluating LLMs as Agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.977121Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:85c7b1cad619447a532553d055d05d4eba65246148e85c404e083260b35b4fa7","observation_id":"7b0cadeb-77ee-44b5-b8a5-fdf99487dfc1","resolution":{"observed_at":"2026-08-07T15:36:25.977121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06526","last_updated":"2025-03-01T12:34:10Z","snapshot_observed_at":"2026-08-08T18:24:11.820620Z","submitted_at":"2024-10-09T03:56:50Z","title":"KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06526","snapshot_observed_at":"2026-08-07T15:36:26.040195Z","title":"KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks.arXiv e-prints, art","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.040195Z"},"links":{"cited_paper":"/paper/2410.06526","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:5ce5d80124297b82baeed00fa5b3bb8baeec90f1151aa30fcc3a6c7b5fbb3105","observation_id":"27c5cf3d-fe22-4478-8d5d-8bbeae278441","resolution":{"observed_at":"2026-08-07T15:36:26.040195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.107011Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.107011Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:f44132c73c391f28918d20a243f7f1757519a072d112c384ebdd898eb7606f39","observation_id":"9ea2814c-fa27-4ae0-969e-375862834618","resolution":{"observed_at":"2026-08-07T15:36:26.107011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.513760Z","title":"Gpt-4o system card","venue":null,"work_id":"a9d35f55-9011-4379-9e91-93841f6d4442","year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.158524Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:45c414eb5d0083d1e432ba78e5aefdd577bf0f874bf599ff48267d9b293e1c53","observation_id":"dd430920-3273-4c6e-97cf-f6be6afeba16","resolution":{"observed_at":"2026-08-07T15:36:31.576336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.315236Z","title":"Learning to reason with llms, 2025","venue":null,"work_id":"31fb5331-f95d-4920-a65c-e17f23c8590b","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.237237Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:c3974473f413a4acba7dc436d74782bef99210ab725485dc7e0c63bd912dc41d","observation_id":"94d794f0-7200-49ed-91cc-395b891b4b40","resolution":{"observed_at":"2026-08-07T15:36:31.424718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T15:36:26.330534Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.330534Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:c6b35e2db0fbb8e28af4d2e20a982c67b03b564618364abec23e7a1a74e720d5","observation_id":"42d97dfd-12c3-4939-9300-b48002441423","resolution":{"observed_at":"2026-08-07T15:36:26.330534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.428286Z","title":"Suttle, Mengdi Wang, Amrit Singh Bedi, and Dinesh Manocha","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.428286Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:6e27b6f026d63f9a35c9a591d4954e0d6730f9f655c70bacfce8c558e6e5c091","observation_id":"eb4bd82a-1258-4ac8-b660-5743f2324925","resolution":{"observed_at":"2026-08-07T15:36:26.428286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T15:36:26.511340Z","title":"Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.511340Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:1b8a37a5396d8707e50cc0dd6980c1ffea0b93412626f90d766c5d16c68ccdcb","observation_id":"5362a652-7c47-42a1-9c99-e4bea08a1484","resolution":{"observed_at":"2026-08-07T15:36:26.511340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-07T16:00:09.967849Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T15:36:26.588538Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.588538Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:db8c1c8e293257e72a72903e6a93ddcf15fa6990ed63bf1df8d3614cc711c4f2","observation_id":"34ceef5a-16a8-4f97-8686-d72cca1ab5ab","resolution":{"observed_at":"2026-08-07T15:36:26.588538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.645654Z","title":"Seed-Thinking-v1.5: Advancing Superb Reasoning Models with Reinforcement Learning.arXiv e-prints, art","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.645654Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:602391c1d3fb75b6f338d9e897f9c8e737434f91a2d8a225351589d43184813c","observation_id":"55ab086b-4587-4598-a334-efef2874c8f8","resolution":{"observed_at":"2026-08-07T15:36:26.645654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.107967Z","title":"Cryptox : Compositional reasoning evaluation of large language models,","venue":null,"work_id":"c566d582-871d-465b-bbbe-4774dcb9e0cd","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.758939Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:ab29340d845e609076924cd53969c05c18e34721515310b23341970565845abf","observation_id":"deb71e0d-5301-406f-b538-3e69c2cfeb36","resolution":{"observed_at":"2026-08-07T15:36:31.217951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T15:36:26.987937Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.987937Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:5310207371bbec79fa77e2551ded790d8543e3a31a41d88161a874349774063b","observation_id":"c91341ca-ff33-4a70-8390-a0e84d86120d","resolution":{"observed_at":"2026-08-07T15:36:26.987937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.924555Z","title":"Reasonggym","venue":null,"work_id":"22b1fda8-6487-40e0-8e1b-60bb57d0e871","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.072869Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:6d97b95c69234a0100333d382111bd4aa85bc9b3186b9fdbfb82aea6869b2c7c","observation_id":"50e4d9b4-c505-43fe-8865-ff226a974bbc","resolution":{"observed_at":"2026-08-07T15:36:31.007874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07813","snapshot_observed_at":"2026-08-07T15:36:26.867470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.867470Z"},"links":{"cited_paper":"/paper/2502.07813","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:9711bb025368251b1227b74545c63ad0d8ff218b0ce4dc36ef04dac99b32d166","observation_id":"21535db2-bb2d-4c3f-a2ec-3be81e92849b","resolution":{"observed_at":"2026-08-07T15:36:26.867470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.740998Z","title":"Qwen3, 2025","venue":null,"work_id":"de1ce7e6-1ee8-45af-9cc5-44df3ffaf173","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.329175Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:4c1ca2fdcdcfd0f3e4dfbc91d204e21ee147c5c9f8ec3ee9495ea39e444e98c9","observation_id":"924c1fd1-cd11-4f80-959f-ed7e886d505d","resolution":{"observed_at":"2026-08-07T15:36:30.840651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.529774Z","title":"Qwen-qwq, 2025","venue":null,"work_id":"b5755725-394a-4143-bac7-905cb9255184","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.436221Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:cef41b32d7e78c71f41fb8966c617f479ff7d28184beca00622a53c57f92bd5c","observation_id":"c780bb53-f80d-4d1a-a662-10079a746703","resolution":{"observed_at":"2026-08-07T15:36:30.621421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:27.216695Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.216695Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:644192849b8fca4b2712c705635479f66b8706a6f9a1615b585c4f6fe01c99c3","observation_id":"1e34d46f-85a4-4871-a635-de2a514e4af5","resolution":{"observed_at":"2026-08-07T15:36:27.216695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07215","last_updated":"2025-05-12T04:01:03Z","snapshot_observed_at":"2026-08-07T15:48:00.354748Z","submitted_at":"2025-05-12T04:01:03Z","title":"Measuring General Intelligence with Generated Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07215","snapshot_observed_at":"2026-08-07T15:36:27.682101Z","title":"Measuring General Intelligence with Generated Games","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.682101Z"},"links":{"cited_paper":"/paper/2505.07215","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:cccf70f8f1142ef4de6031bbf1ea7f829f1967c3bdf292f922948f1b1ace1444","observation_id":"b380370e-9acc-4f3e-a302-b99f85dadf03","resolution":{"observed_at":"2026-08-07T15:36:27.682101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.bea-1.52","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.355810Z","title":"Evaluating reading comprehension exercises generated by LLMs: A showcase of ChatGPT in education applications","venue":null,"work_id":"a453f69f-6079-4901-b24e-9ab96a53dd31","year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.748039Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:f5060da674390bec7a6d818fe9bf222c181747b0af8312ed7e3e621e055fbd95","observation_id":"1a57d53b-cf90-4b11-9a0c-2e830e259b99","resolution":{"observed_at":"2026-08-07T15:36:30.434502Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-07T15:36:27.571656Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.571656Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:78dea5fa18cc5aea6a6bb86cc4b57da26695a3c50aa5dbe53383400c054a560b","observation_id":"12dc98fb-b338-4158-be69-e4aeaa26ef59","resolution":{"observed_at":"2026-08-07T15:36:27.571656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04658","last_updated":"2024-05-11T07:08:16Z","snapshot_observed_at":"2026-08-05T22:16:53.109945Z","submitted_at":"2023-09-09T01:56:40Z","title":"Exploring Large Language Models for Communication Games: An Empirical Study on Werewolf","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04658","snapshot_observed_at":"2026-08-07T15:36:27.888031Z","title":"Exploring large language models for communication games: An empirical study on werewolf.arXiv preprint arXiv:2309.04658, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.888031Z"},"links":{"cited_paper":"/paper/2309.04658","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:551487477e1ff855298d777f437381b2e44c9f59bbb7d65abcc90ff867b0874e","observation_id":"7fd0e5d2-d6ce-4b80-ae3a-2cb1f4450964","resolution":{"observed_at":"2026-08-07T15:36:27.888031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:27.945596Z","title":"SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially? arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.945596Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:84ae50e17bc252650341b5ec64153bcdabb1f6cd646f13b22732f4c4195a00e6","observation_id":"d63088b6-d85d-422e-bcfb-f322d7c7aa8b","resolution":{"observed_at":"2026-08-07T15:36:27.945596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01622","last_updated":"2024-10-23T15:02:57Z","snapshot_observed_at":"2026-08-09T18:10:25.295507Z","submitted_at":"2024-02-02T18:39:51Z","title":"TravelPlanner: A Benchmark for Real-World Planning with Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01622","snapshot_observed_at":"2026-08-07T15:36:27.825926Z","title":"Travelplanner: A benchmark for real-world planning with language agents.arXiv preprint arXiv:2402.01622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.825926Z"},"links":{"cited_paper":"/paper/2402.01622","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:8545b481a26b3dadee3a89577820b6055ed20321ba45af12e9334a77df772ab5","observation_id":"bd4733b0-9070-470a-b16c-076790d5aa46","resolution":{"observed_at":"2026-08-07T15:36:27.825926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:36:28.095327Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.095327Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:697db709057aac7f41398cc010173b745a00d9072bfe2489c95ff2411930c827","observation_id":"cda1f626-b060-455b-89a8-a02f3d16b44e","resolution":{"observed_at":"2026-08-07T15:36:28.095327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:28.037737Z","title":"Spin-bench: How well do llms plan strategically and reason socially?arXiv preprint arXiv:2503.12349, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.037737Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:d6f3b4f50e3b7ca5d5f3dcb3c61e1ad1f3f7a6191208852734d5c06052c12079","observation_id":"7ff2f81f-da54-401b-a0d4-6f12a89bf8ac","resolution":{"observed_at":"2026-08-07T15:36:28.037737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.199754Z","title":null,"venue":null,"work_id":"bb35c3e2-ad61-41a5-bd9c-b66fd2614204","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.157840Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:7140f0bc389ea5f03481e6122bf2411a21c4233f304b7972a061b249ed185080","observation_id":"486d6cb4-8d90-4981-8442-87b25c809cf5","resolution":{"observed_at":"2026-08-07T15:36:30.287513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:29.967152Z","title":null,"venue":null,"work_id":"8fd5e5c4-2e69-4051-9e03-8bf38e970bff","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.221860Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:f05dc8f9e49c94230ca42670ef0b3b753d17d42737451ee422a89a8db8964362","observation_id":"e824cf0e-3958-4ea0-9063-12e665a7e527","resolution":{"observed_at":"2026-08-07T15:36:30.084809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:29.726698Z","title":"P (Q → A | R, K) ≈ P (Q → A | R) ≫ P (Q → A | K)","venue":null,"work_id":"1f7178f1-09d8-48d2-b638-994d0503a1de","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.403723Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:17c81a9219e8bf3c35486bac17c1e795ffb568bcdf0c8f19770d69bd330db73f","observation_id":"9e0ba033-0a14-4fd0-8542-7879ef4e97c3","resolution":{"observed_at":"2026-08-07T15:36:29.839405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:29.580946Z","title":"P (Q → A | R, K) =P (Q → A | R) · (1 +β) 19 C Detailed Scores on KORGym Table 7 Mathematical and logical reasoning abilities of different models on KORGym","venue":null,"work_id":"1cdf5ad7-907f-41b0-9fde-f5661f5aef1d","year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.526144Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:5d929c503da5bc90ebe1f423d05a49d26177a383adcdb01bb5cda5f5baa38a76","observation_id":"74904f33-5630-477e-a0f7-ead6468311fc","resolution":{"observed_at":"2026-08-07T15:36:29.632711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2410.03131","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:28.919590Z","title":null,"venue":null,"work_id":"80a430aa-f01e-4bb7-9bf8-5f20d445d2c0","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.457130Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:769751aff616ca2c1e7e0ddeebd7db7e12136bebc374c0283708e64720e069de","observation_id":"494c182e-e177-4d2f-8803-949577c538c2","resolution":{"observed_at":"2026-08-07T15:36:29.035805Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.714925Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.714925Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:8c9a17a06f59166359be8e50753d594ee786f458f76df627b7fece7cc254cd9f","observation_id":"dfe2aae8-85be-4162-9a00-4a53893e83c5","resolution":{"observed_at":"2026-08-07T15:36:26.714925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2505.14552."}