{"as_of":"2026-08-10T15:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a19e82764c932996d667215d49e419408374c5cc8948118126eb12513092179c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:13:15.438371Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:57:02.003590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00726","snapshot_observed_at":"2026-08-01T08:57:02.003590Z","title":"Can large lan- guage models develop strategic reasoning? post-training insights from learning chess.arXiv preprint arXiv:2507.00726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20952","last_updated":"2026-07-27T07:48:14Z","snapshot_observed_at":"2026-08-07T18:50:10.123328Z","submitted_at":"2026-07-23T06:18:43Z","title":"The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:02.003590Z"},"links":{"cited_paper":"/paper/2507.00726","citing_paper":"/paper/2607.20952"},"observation_digest":"sha256:002c91b68ab17ef5811efddf03a06be39bc0b0b397bed0517aafbcfa4ba9d7a7","observation_id":"d7f9eae7-12e7-4379-aaea-ec90088c20bb","resolution":{"observed_at":"2026-08-01T08:57:02.003590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00726/citation-record","integrity":"/paper/2507.00726/integrity","json":"/paper/2507.00726/citation-record.json","paper":"/paper/2507.00726"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:14.562989Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.562989Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:3a7c7b94aae8455aab87b4f1a17dcc196eb505edd4da3be08b0794df0133714e","observation_id":"4f523d3a-94c7-4424-857c-5d1edba60f18","resolution":{"observed_at":"2026-08-06T21:13:14.562989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:16.006055Z","title":null,"venue":null,"work_id":"ed1452da-081b-4d84-9b6d-faa065fd621b","year":1994},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.602250Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:36bb7a8731bccaa4c02624c478b91ffe05d9ec6ceba51318a5ba5d240c0e5f48","observation_id":"45a3217f-1ab5-4a3c-bac4-a3fa983b97bb","resolution":{"observed_at":"2026-08-06T21:13:16.011700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.989348Z","title":"Chessgpt: Bridging policy learning and language modeling","venue":null,"work_id":"9fd05cf6-03b1-419c-affa-5e80c8df328e","year":2023},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.636904Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:220327940311a8ece28d286f229c042ba9ce508456480bff705a32144d97a4ce","observation_id":"50699f88-3097-4635-9f23-0e6dc5c007cf","resolution":{"observed_at":"2026-08-06T21:13:15.995114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:13:14.673504Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.673504Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:b18c17149acf60bad849a839c8f8c97e0f7fb75e0b97a787d85368c3d9e8fc38","observation_id":"1478d935-a06a-48d6-bd50-aada7116b6cc","resolution":{"observed_at":"2026-08-06T21:13:14.673504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:13:14.708823Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.708823Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:4d10fd201451680bf166f910a8c1c2e8fd19b1b1164f662647f1a39956f25d36","observation_id":"5a9e949a-8796-4961-8374-ef58ad103bde","resolution":{"observed_at":"2026-08-06T21:13:14.708823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22828","last_updated":"2025-09-08T02:43:27Z","snapshot_observed_at":"2026-08-08T06:20:07.492846Z","submitted_at":"2025-03-28T18:48:26Z","title":"Learning to Reason for Long-Form Story Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22828","snapshot_observed_at":"2026-08-06T21:13:14.743741Z","title":"Learning to reason for long-form story generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.743741Z"},"links":{"cited_paper":"/paper/2503.22828","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:e51e0dbd22836445b3a28c694fee26908cc0750be087a6b20dc25196b52562ec","observation_id":"a27acc06-c949-4c8c-8792-6b2e0fbe7e01","resolution":{"observed_at":"2026-08-06T21:13:14.743741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.971460Z","title":"Improving regression performance with distributional losses","venue":null,"work_id":"29a59f14-ee6d-4231-b48d-ce63d857ba98","year":2018},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.778740Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:0d13d60b2ea2d8d916f00255aa631314cdf924b55e7ba45251ed40aa1bbd0bdf","observation_id":"219e7b23-2f66-41dd-a309-695a3ec33382","resolution":{"observed_at":"2026-08-06T21:13:15.977225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.952866Z","title":"Bridging the gap between expert and language models: Concept-guided chess commentary generation and evaluation","venue":null,"work_id":"262f4a80-b109-497b-8c43-3677686c821a","year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.814753Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:734b603bba343cedc3a81194a88e669ffd0e891cfc25f3f64624d4f19feca433","observation_id":"67fda46f-0282-43ae-ab8e-130dc8072787","resolution":{"observed_at":"2026-08-06T21:13:15.958182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T21:13:14.849487Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.849487Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:c2ac8f47504787984511e7405659798c262856bca92c1c0a03eecebd0ac211f9","observation_id":"37d0b883-01d8-4c91-8fb0-10d8a25cfbaa","resolution":{"observed_at":"2026-08-06T21:13:14.849487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-08-09T18:38:39.510086Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-06T21:13:14.885294Z","title":"Llms can easily learn to reason from demonstrations structure, not content, is what matters! arXiv preprint arXiv:2502.07374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.885294Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:f63ec15c8342a389125c50cfbc9dc3152c9c8a05e9db0623c0c3c5591c7fed83","observation_id":"12671650-3fc0-4ac1-a651-65143299ec16","resolution":{"observed_at":"2026-08-06T21:13:14.885294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T21:13:14.920254Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.920254Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:9ea614de2f210cf691a5308557b030cbcaf0977baa2c3a6999ea6be860603ec8","observation_id":"7265002d-5809-4e71-8fea-62d52dd94b3e","resolution":{"observed_at":"2026-08-06T21:13:14.920254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T21:13:14.955840Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.955840Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:6344ec23ca32ff97e6b749ea12d3a3da95801fb019331ef3466a69d7c27e127b","observation_id":"cf7ab677-32a9-444a-bad0-724cf9baecde","resolution":{"observed_at":"2026-08-06T21:13:14.955840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03610","last_updated":"2026-04-14T22:54:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-04T06:40:33Z","title":"Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03610","snapshot_observed_at":"2026-08-06T21:13:14.990922Z","title":"Orak: A foundational benchmark for training and evaluating llm agents on diverse video games","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.990922Z"},"links":{"cited_paper":"/paper/2506.03610","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:1f1aedb42a810e0b849085a7d591a1430962d420793db5cc6a8e16872ca3ba7e","observation_id":"e6de8796-08e3-4c08-83e8-a16d9920ca50","resolution":{"observed_at":"2026-08-06T21:13:14.990922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:13:15.027217Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.027217Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:5dceea45e40fb44e8586cb3978cbe3fbb797ad26a770ad027c6b77d1997791dc","observation_id":"c5723c9a-921d-4b84-8298-04b430d1952d","resolution":{"observed_at":"2026-08-06T21:13:15.027217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.934452Z","title":"Amortized planning with large-scale transformers: A case study on chess","venue":null,"work_id":"c9da8789-ee4c-4ca4-91cb-3d23f4ae3fce","year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.062066Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:0e5db3025405ce96f74102985aa12963d2b19ff041c0cd1d234f1b6402734219","observation_id":"720c2cf2-b5e0-4e70-ab0c-5b5526cd2638","resolution":{"observed_at":"2026-08-06T21:13:15.941797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-10T11:02:14.031196Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T21:13:15.096866Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.096866Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:ed9eefe10ecae8f2dd06e344d01eb15e510d77e5c9327424328efa03b016a357","observation_id":"bf7edc7d-f230-4347-9a5c-06a11217689c","resolution":{"observed_at":"2026-08-06T21:13:15.096866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T21:13:15.133788Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.133788Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:76508eca3b4e59924f9d469ebabee866a02ed1a373a40b15a19de6ab8cd6f208","observation_id":"f464150f-8539-46dd-9e52-8aaf5f9616dc","resolution":{"observed_at":"2026-08-06T21:13:15.133788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T21:13:15.168117Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.168117Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:050b7d6310c8038c87f924cbfa3c3a16dbd766113b11c3febd575fabeaa17562","observation_id":"9dd87893-dd80-4af9-8fa7-5460330dd696","resolution":{"observed_at":"2026-08-06T21:13:15.168117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-06T21:13:15.204837Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.204837Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:4868baacd6e82ececd0a0c506d4fb2510698d4392438d0438af50829c6e5bac5","observation_id":"9e9e4522-fbce-4ae5-ac6d-afa829209472","resolution":{"observed_at":"2026-08-06T21:13:15.204837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.240659Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.240659Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:b759d924017b00f349bf2dce47b600745dfb10fc68f8adb5e2ca2672de204c6a","observation_id":"ac25e364-83af-4805-bc3c-61e9b5e52045","resolution":{"observed_at":"2026-08-06T21:13:15.240659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06655","last_updated":"2025-02-28T11:58:28Z","snapshot_observed_at":"2026-08-08T02:36:46.949082Z","submitted_at":"2024-11-11T01:42:56Z","title":"Explore the Reasoning Capability of LLMs in the Chess Testbed","version":2},"cited_work":{"arxiv_id":"2411.06655","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.06655","snapshot_observed_at":"2026-08-06T21:13:15.632627Z","title":"Explore the Reasoning Capability of LLMs in the Chess Testbed","venue":"cs.CL","work_id":"9714dd70-fb49-4758-aafe-ac7ae633aaf5","year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.275175Z"},"links":{"cited_paper":"/paper/2411.06655","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:33d9c542cc26252bc832a5ff1e69f5856867d3b3dc8f591b528852de50791190","observation_id":"32e410e0-aecd-43f8-b37e-3f295d39d486","resolution":{"observed_at":"2026-08-06T21:13:15.641036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-06T21:13:15.311542Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.311542Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:5fe6c7ef0ae8c9f481a814206ba95a16b1549ee4be9e2c23295c487b0e6d23de","observation_id":"d94fe74a-0bdd-4957-91ea-b8875bf22864","resolution":{"observed_at":"2026-08-06T21:13:15.311542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T21:13:15.347231Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.347231Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:51f20488ef6dc6c3012888d7a275881b45ded79f692246d64ecaf7dedf6daaf4","observation_id":"1e8cd449-4306-4088-8306-33b72a2f453f","resolution":{"observed_at":"2026-08-06T21:13:15.347231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T21:13:15.383047Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.383047Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:e130509365fd1f0fc3d5e601112865d63aa7d80c31f50f4a6c62ee4f2ecba094","observation_id":"a3dbd584-e7dc-47d8-80f3-c14f00d2d54f","resolution":{"observed_at":"2026-08-06T21:13:15.383047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19655","last_updated":"2025-02-27T00:54:38Z","snapshot_observed_at":"2026-08-07T21:58:54.817701Z","submitted_at":"2025-02-27T00:54:38Z","title":"Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19655","snapshot_observed_at":"2026-08-06T21:13:15.388077Z","title":"Med-rlvr: Emerging medical reasoning from a 3b base model via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.388077Z"},"links":{"cited_paper":"/paper/2502.19655","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:360ec07b500b05fb5962bcfc16d88ac74c381e5e09aec30935e931a51145b264","observation_id":"ffb13532-71c1-4418-b679-f952e7921f18","resolution":{"observed_at":"2026-08-06T21:13:15.388077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01230","last_updated":"2024-04-01T16:50:54Z","snapshot_observed_at":"2026-08-07T22:32:40.077692Z","submitted_at":"2024-04-01T16:50:54Z","title":"LLM as a Mastermind: A Survey of Strategic Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01230","snapshot_observed_at":"2026-08-06T21:13:15.393896Z","title":"Llm as a mastermind: A survey of strategic reasoning with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.393896Z"},"links":{"cited_paper":"/paper/2404.01230","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:53bf1491a4e079a77a7a143a1f30117e740ee32a1173fa5f90df35092832eb46","observation_id":"30d2e018-9101-4a3e-b509-31e9071a9cfa","resolution":{"observed_at":"2026-08-06T21:13:15.393896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.907071Z","title":"Complete chess games enable LLM become a chess master","venue":null,"work_id":"84b8a001-c64c-4905-bb66-a88dec39fa46","year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.399974Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:1350431e896c108b9abe53cfbc3304ea0034ac5c0835b03d30a2d7a10efbee0b","observation_id":"27f828f5-7772-42e0-878a-8a4b404ad8a7","resolution":{"observed_at":"2026-08-06T21:13:15.912353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19557","last_updated":"2025-02-26T20:50:11Z","snapshot_observed_at":"2026-08-09T06:45:38.273472Z","submitted_at":"2025-02-26T20:50:11Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19557","snapshot_observed_at":"2026-08-06T21:13:15.405997Z","title":"Distill not only data but also rewards: Can smaller language models surpass larger ones? arXiv preprint arXiv:2502.19557, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.405997Z"},"links":{"cited_paper":"/paper/2502.19557","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:3c297dc6974776de0854f3492c118d8dcdbe3697064db11f060595f2f55990ce","observation_id":"2e6717eb-45a6-40a0-ab59-0e9be9669c13","resolution":{"observed_at":"2026-08-06T21:13:15.405997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-06T21:13:15.411620Z","title":"Absolute zero: Reinforced self-play reasoning with zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.411620Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:e84ba4f0b08d4a3576f4d9b9b9c963ef8f12f86ec6e159bbd5732e0d5b1fc89f","observation_id":"3d424eeb-176a-41e2-9fe5-0ff6b21aa5d9","resolution":{"observed_at":"2026-08-06T21:13:15.411620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-09T01:40:08.645048Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-06T21:13:15.416519Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.416519Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:a5faa1fdb414215159c884e5940e27f82bbe82d7d86bf45ef8b505eb0a19a776","observation_id":"cbb9ee45-ebdf-46fe-9dd0-c32d2aec739b","resolution":{"observed_at":"2026-08-06T21:13:15.416519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T21:13:15.421675Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.421675Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:6027a50b78b09b9f7c20f3db6fc668fb6382aaa67cf9cec1629d58fc8285ed7c","observation_id":"325fed64-2de9-4f52-a07f-19e0f6dd0cb4","resolution":{"observed_at":"2026-08-06T21:13:15.421675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.427861Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.427861Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:7f2473e529fa1bdd442850a72cd37bb4eceab2cc2be1d62a38cdfd0954490498","observation_id":"5f8ed20e-7cc6-4427-a66c-026994472dbf","resolution":{"observed_at":"2026-08-06T21:13:15.427861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.433040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.433040Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:a091bbf7f3a66e34c53b7da24b1b743e3a1b10c17ecdce66b263efe3f805d296","observation_id":"fbae588f-ffbb-4ce6-8647-1327ecf9de9e","resolution":{"observed_at":"2026-08-06T21:13:15.433040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.438371Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.438371Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:64731392e8426b3d4bb7e26d2785bb7c8fbaa3fd64d25333eaa1dd1e4000de4e","observation_id":"a4c06d96-8721-4c7a-93a9-4a33430379b9","resolution":{"observed_at":"2026-08-06T21:13:15.438371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T03:39:48.813789Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2507.00726."}