{"as_of":"2026-08-22T16:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44cf052d3eaca375ef43ef805103bdf2f1c10d179fd9c310dba250b739440788","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":85,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:29:18.697529Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:08.414065Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2406.11290","last_updated":"2026-04-11T06:17:39Z","snapshot_observed_at":"2026-07-06T18:32:02.206165Z","submitted_at":"2024-06-17T07:52:42Z","title":"An Iterative Utility Judgment Framework Inspired by Philosophical Relevance via LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T00:14:42.779546Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2406.11290"},"observation_digest":"sha256:a9e2775b1c3b8fa0129ee525ee9ce2730829d7429ee336ac0bf7941ecc536cb3","observation_id":"ab4126f8-e276-4acd-b497-4213e1f02631","resolution":{"observed_at":"2026-05-24T00:15:52.765918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:4193279319d9234bb3dda64033fef6ade929b6aae3253ff6ed78f25dc12fb842","observation_id":"84baa3d2-b09e-4f5a-8843-044468b627a2","resolution":{"observed_at":"2026-05-17T12:04:10.514436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T01:42:19.004468Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2410.08146"},"observation_digest":"sha256:357e1d5c0e7d744f1d96d567dbbb5119498b970a3126b9148715a9715cf4059a","observation_id":"eb350d8c-a9ab-4afd-9829-fd1f3060fba9","resolution":{"observed_at":"2026-05-21T01:42:19.127139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-12T13:02:57.278896Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16579","last_updated":"2024-11-25T17:11:54Z","snapshot_observed_at":"2026-08-12T12:55:35.142701Z","submitted_at":"2024-11-25T17:11:54Z","title":"Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T13:02:57.278896Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2411.16579"},"observation_digest":"sha256:8a6352c6c040e0265dd968bf191b9555773a682932ba946d39c6ad24f98db5b7","observation_id":"599203ec-1368-4c74-ac60-8e2e8612a6ba","resolution":{"observed_at":"2026-08-12T13:02:57.278896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-12T12:45:20.080762Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.080762Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:a350e93bc81cf418407e9af6f2ef7295ca640b47e32e93626039f561e6f122e6","observation_id":"671dc132-9b2f-4109-9e30-31bbe50d3824","resolution":{"observed_at":"2026-08-12T12:45:20.080762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T23:15:28.701530Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02674","last_updated":"2025-02-25T16:59:11Z","snapshot_observed_at":"2026-08-14T20:58:55.959220Z","submitted_at":"2024-12-03T18:47:26Z","title":"Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:15:28.701530Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.02674"},"observation_digest":"sha256:f5067f94ff6d06fa2526bc49d80624a6a508fbcfda72f7741457bd5ff92dad76","observation_id":"bd27e811-fe89-4086-94dc-46179857da5f","resolution":{"observed_at":"2026-08-11T23:15:28.701530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T22:57:01.993575Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":179,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.993575Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:a407905bfae8e0d9ce8acbe97fae0752fe13f3f2fd8cd5d810b2111bb59e8b81","observation_id":"6725648c-4b04-4e3c-a9ad-83294051fed6","resolution":{"observed_at":"2026-08-11T22:57:01.993575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:dada5469a6c7377b234ae5fc6da03a84cef518801442ac43804d1e70a73bc287","observation_id":"36080728-174d-4ffb-b838-7c44684f950c","resolution":{"observed_at":"2026-05-11T23:08:34.726256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T17:55:13.556210Z","title":"Beyond human data: Scaling self-training for problem-solving with lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08442","last_updated":"2024-12-11T15:06:25Z","snapshot_observed_at":"2026-08-16T15:18:46.024318Z","submitted_at":"2024-12-11T15:06:25Z","title":"From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T17:55:13.556210Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.08442"},"observation_digest":"sha256:bd40cd6e0ec58abd4913d7644e5c8e8ce83e16ea955b9610b391ac79d192aa96","observation_id":"dfb035d9-6bd0-4e64-941e-10e63facb169","resolution":{"observed_at":"2026-08-11T17:55:13.556210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T17:34:19.630654Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08819","last_updated":"2024-12-11T23:31:06Z","snapshot_observed_at":"2026-08-18T08:24:01.522950Z","submitted_at":"2024-12-11T23:31:06Z","title":"HARP: A challenging human-annotated math reasoning benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:34:19.630654Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.08819"},"observation_digest":"sha256:43ed94853c0b604024660ff0b9545c8e55e728fa512df53e5c616ef9a4d0d611","observation_id":"784b433b-36f8-4e23-9228-587c27d7f4a1","resolution":{"observed_at":"2026-08-11T17:34:19.630654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T12:05:48.535997Z","title":"D., Agarwal, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14689","last_updated":"2025-05-28T05:22:58Z","snapshot_observed_at":"2026-08-15T08:21:08.511659Z","submitted_at":"2024-12-19T09:43:39Z","title":"How to Synthesize Text Data without Model Collapse?","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T12:05:48.535997Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.14689"},"observation_digest":"sha256:a7356efd64b0fd788575814e38983cfd8321c5478672cc6b6225ffbd7191ca7f","observation_id":"6db31b5e-4b51-4255-bb88-9c30d78efb5a","resolution":{"observed_at":"2026-08-11T12:05:48.535997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T10:50:19.089699Z","title":"arXiv preprint arXiv:2312.06585","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-08-18T16:03:34.886701Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:50:19.089699Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.16145"},"observation_digest":"sha256:72710b4811fdd7972175c97a2b5d6bcf8659380b4e569136a3bed412c1a3a8b8","observation_id":"265d8a8a-7cc2-41c6-a0ca-0744a93834d0","resolution":{"observed_at":"2026-08-11T10:50:19.089699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T05:45:00.426531Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-21T07:11:45.974138Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.426531Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:640462ad085a313dbe48b9edaafa4ca1c702c2adb93d765e58af85523963501a","observation_id":"9f49c1a7-e212-4bc3-a9ba-bc786c6bdd6b","resolution":{"observed_at":"2026-08-11T05:45:00.426531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T05:32:38.975103Z","title":"D., Agarwal, R., Anand, A., Patil, P., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17451","last_updated":"2025-06-06T10:36:59Z","snapshot_observed_at":"2026-08-17T00:50:40.901836Z","submitted_at":"2024-12-23T10:18:41Z","title":"Diving into Self-Evolving Training for Multimodal Reasoning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:38.975103Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.17451"},"observation_digest":"sha256:309c40b5d4b3c3e698620b185fcc97953fa054315eb66df2d317f0f7d13d03fb","observation_id":"dff38718-995e-490a-abe9-9cc6bbafe7eb","resolution":{"observed_at":"2026-08-11T05:32:38.975103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-10T23:05:01.531805Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00125","last_updated":"2024-12-30T19:58:13Z","snapshot_observed_at":"2026-08-13T19:32:26.257460Z","submitted_at":"2024-12-30T19:58:13Z","title":"Can Large Language Models Improve SE Active Learning via Warm-Starts?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:01.531805Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2501.00125"},"observation_digest":"sha256:e4627e707b4cd87e85fdcc15a95f6c43267faa6c4b4befa5a666ac32d7793275","observation_id":"a59cf79e-a084-41e7-bdb3-7e90ec44fad5","resolution":{"observed_at":"2026-08-10T23:05:01.531805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-10T20:35:59.518256Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07861","last_updated":"2025-01-14T05:56:26Z","snapshot_observed_at":"2026-08-15T03:54:54.866456Z","submitted_at":"2025-01-14T05:56:26Z","title":"ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:59.518256Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2501.07861"},"observation_digest":"sha256:9d5a6f2696066f9aa78e519f3f9e15db8b12f4e100eeca66b929d220ada7ef76","observation_id":"62c545dd-1679-48f5-8457-0d0f6884a179","resolution":{"observed_at":"2026-08-10T20:35:59.518256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-10T18:30:56.604968Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-15T17:15:16.352032Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:30:56.604968Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2501.11284"},"observation_digest":"sha256:58b93e4b7248622e0f8481fcc3d9d335afe8cf47351419a91ccf1f7e7a0cc072","observation_id":"5e346fb3-ea88-4136-a0bd-213e91797571","resolution":{"observed_at":"2026-08-10T18:30:56.604968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T22:20:13.811949Z","title":", Co-Reyes, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-21T11:54:44.771129Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.811949Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:65e0ad106aa1da669e32d557304450a39662b990ba6938c365988b7e91f53cc9","observation_id":"faeffd8c-00fd-4ec4-83ba-5d5f2b921b3e","resolution":{"observed_at":"2026-08-09T22:20:13.811949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T18:07:52.191287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00691","last_updated":"2025-07-18T07:40:22Z","snapshot_observed_at":"2026-08-20T12:59:05.656899Z","submitted_at":"2025-02-02T06:32:23Z","title":"To Code or not to Code? Adaptive Tool Integration for Math Language Models via Expectation-Maximization","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T18:07:52.191287Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.00691"},"observation_digest":"sha256:5b7008b1156757d4a851bed3f79e0bde0151ae16c231bbd76fc787d005df3201","observation_id":"ff08f82e-cf01-4bb5-b43e-b7374402512b","resolution":{"observed_at":"2026-08-09T18:07:52.191287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T14:54:29.266882Z","title":"D., Agarwal, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01612","last_updated":"2025-02-13T05:32:54Z","snapshot_observed_at":"2026-08-18T05:44:18.840497Z","submitted_at":"2025-02-03T18:45:22Z","title":"Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T14:54:29.266882Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.01612"},"observation_digest":"sha256:411a18f2d02fbf329d449db3d192f4f021df5bb6b0c2ace80b54cd1a889b6c97","observation_id":"ac222a59-b313-4bcc-bae0-bc83508d9445","resolution":{"observed_at":"2026-08-09T14:54:29.266882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T11:47:31.305500Z","title":"D., Agarwal, R., Anand, A., Patil, P., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02584","last_updated":"2025-02-04T18:58:31Z","snapshot_observed_at":"2026-08-20T01:51:16.495363Z","submitted_at":"2025-02-04T18:58:31Z","title":"QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:31.305500Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.02584"},"observation_digest":"sha256:eb492b4088d159409203c31e417dc739b384a4bf35ff7fd7e87e0bf1a9bff1ee","observation_id":"9d71f355-0c72-46e5-90a0-db7e7604bc31","resolution":{"observed_at":"2026-08-09T11:47:31.305500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-08-17T16:40:23.847561Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T01:29:59.353698Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.03373"},"observation_digest":"sha256:61f981271dd50d836ca106bab9c985cdb043f8612d96098f002b1afe2f65c54d","observation_id":"b96d62a6-a0d1-4148-bbf0-1a7fce3401f7","resolution":{"observed_at":"2026-05-19T01:29:59.416718Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T10:50:12.483673Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04362","last_updated":"2025-02-05T04:52:57Z","snapshot_observed_at":"2026-08-17T22:58:44.257563Z","submitted_at":"2025-02-05T04:52:57Z","title":"LLMs can be easily Confused by Instructional Distractions","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T10:50:12.483673Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.04362"},"observation_digest":"sha256:7de18d07f43e5aa786a8fe5da34351b40d8f482d3f3d3d86cabe4688b3dccbc3","observation_id":"2957bce5-2342-4b0d-b755-bf63fd216b50","resolution":{"observed_at":"2026-08-09T10:50:12.483673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-08T14:27:51.152051Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-16T03:56:33.383172Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.152051Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:4696360f02c85d884c43c76802f1cf1603f454308573e6e6746e6da0ca39f89f","observation_id":"2c04f306-b46e-4265-ba4b-088a53fde1bc","resolution":{"observed_at":"2026-08-08T14:27:51.152051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T11:20:31.874537Z","title":"D., Agarwal, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06813","last_updated":"2025-02-04T22:08:20Z","snapshot_observed_at":"2026-08-19T15:43:28.621336Z","submitted_at":"2025-02-04T22:08:20Z","title":"Policy Guided Tree Search for Enhanced LLM Reasoning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T11:20:31.874537Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.06813"},"observation_digest":"sha256:e8d8ba36b8d9149a2355ec35858fa7699c3201fb206463885df98c20b190df6e","observation_id":"984f8bfb-1d13-4390-9e06-041949791329","resolution":{"observed_at":"2026-08-09T11:20:31.874537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-20T08:13:05.630967Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:f468ed8b01162ea23324599a744355baa71203a640b18d37b61418622a5647f4","observation_id":"f91fb950-3512-4d62-9f44-2f9d72aaa330","resolution":{"observed_at":"2026-05-13T01:36:24.273524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:5fceab495918e0484a735cc25a312e60e754eb6a00cea8910e80b07bcdae8339","observation_id":"e247596f-c4d8-45a6-9b26-2b9f341b0783","resolution":{"observed_at":"2026-05-19T06:59:03.257668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-08-12T16:45:40.094278Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:08284ce7979194401442edbe9c0ef72cf27413faf8502fbbab0bd75addc56b99","observation_id":"2bcb275e-3172-40ef-9dad-2bf894550a60","resolution":{"observed_at":"2026-05-22T21:42:10.791523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-16T10:29:18.697529Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18116","last_updated":"2025-04-25T06:48:55Z","snapshot_observed_at":"2026-08-19T10:22:27.362484Z","submitted_at":"2025-04-25T06:48:55Z","title":"Think, Prune, Train, Improve: Scaling Reasoning without Scaling Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:29:18.697529Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2504.18116"},"observation_digest":"sha256:7398d9f28e81e0d7927f44d96ae4edb9da9734ddca5ef6e4c923ad6e082443fd","observation_id":"d7a45e69-b45a-45a8-98ac-eb70033b135c","resolution":{"observed_at":"2026-08-16T10:29:18.697529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-16T05:53:51.778603Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00031","last_updated":"2025-04-28T06:32:58Z","snapshot_observed_at":"2026-08-19T21:13:54.883948Z","submitted_at":"2025-04-28T06:32:58Z","title":"Learning to Plan Before Answering: Self-Teaching LLMs to Learn Abstract Plans for Problem Solving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:51.778603Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.00031"},"observation_digest":"sha256:36f739ed7d25dd0c04e19c3059c6dd063fceaf3e6cc11558560739a5954a3457","observation_id":"c0da9749-2e12-439c-b471-e5f0f21f102a","resolution":{"observed_at":"2026-08-16T05:53:51.778603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-16T00:59:21.839510Z","title":"D., Agarwal, R., Anand, A., Patil, P., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-21T16:22:34.302580Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:59:21.839510Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.02391"},"observation_digest":"sha256:3b671b86344820b95644c147c97533af0486cc53872ba5c9bf85faaff352de79","observation_id":"0e8eca2d-c256-4575-8604-84bef9de3477","resolution":{"observed_at":"2026-08-16T00:59:21.839510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-15T22:19:24.875235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07512","last_updated":"2025-05-12T12:48:30Z","snapshot_observed_at":"2026-08-19T11:16:42.021681Z","submitted_at":"2025-05-12T12:48:30Z","title":"ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:19:24.875235Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.07512"},"observation_digest":"sha256:220c5ace9f1edb4e5585c2c7b7e26deab2fbc4362ad55b3cc10aa5fc1afebd10","observation_id":"c867417d-8074-48fa-98a7-66b68caf33a9","resolution":{"observed_at":"2026-08-15T22:19:24.875235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-15T22:08:55.035502Z","title":"Singh, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17040","last_updated":"2025-05-13T01:00:12Z","snapshot_observed_at":"2026-08-20T04:45:28.447223Z","submitted_at":"2025-05-13T01:00:12Z","title":"Generalizing Large Language Model Usability Across Resource-Constrained","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-15T22:08:55.035502Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.17040"},"observation_digest":"sha256:2631d618014fe34e5e48c41c1728ff5afb6400d8e96736a59af5072b64c9795c","observation_id":"1b0d8153-130a-4b51-ad38-58be24bf47bb","resolution":{"observed_at":"2026-08-15T22:08:55.035502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T14:50:05.227428Z","title":"arXiv preprint arXiv:2312.06585 (2023) 12 J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17470","last_updated":"2025-05-23T04:50:54Z","snapshot_observed_at":"2026-08-19T14:39:02.388110Z","submitted_at":"2025-05-23T04:50:54Z","title":"SLearnLLM: A Self-Learning Framework for Efficient Domain-Specific Adaptation of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:50:05.227428Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.17470"},"observation_digest":"sha256:d927eae4d69263e8d2e6f3901a67c37f14b178078c4a6b99d499543ed602dbb4","observation_id":"d1f3863e-7606-483e-a643-b3fc8dfbc7fe","resolution":{"observed_at":"2026-08-07T14:50:05.227428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T14:12:05.364648Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-13T22:06:58.555085Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:05.364648Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:7040fa8f716577f2f9091a13b8f4c6cbbff7f9d89b1f4b10130b05b8d6ae1bf7","observation_id":"2b550a2a-2d34-4a83-a7ac-7634953fc29d","resolution":{"observed_at":"2026-08-07T14:12:05.364648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T13:07:50.094799Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-13T20:01:21.267324Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:50.094799Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.22660"},"observation_digest":"sha256:61c31be8df1bd15fb024a827c0ce385658dda12c1f721ae32b38c0b0b322a2b4","observation_id":"e6128fac-ad80-4c3e-8161-404773e5b32b","resolution":{"observed_at":"2026-08-07T13:07:50.094799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T12:39:57.636759Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-14T15:23:26.882834Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.636759Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:b45206d843aad02280eb257ce4fc351d999690274327116b7ce46c910501aff2","observation_id":"0d04703e-ce4e-42be-a82d-05ff6f566335","resolution":{"observed_at":"2026-08-07T12:39:57.636759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T05:59:04.390203Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06499","last_updated":"2025-06-17T12:55:30Z","snapshot_observed_at":"2026-08-21T13:03:26.624960Z","submitted_at":"2025-06-06T19:49:42Z","title":"SPARQ: Synthetic Problem Generation for Reasoning via Quality-Diversity Algorithms","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:04.390203Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2506.06499"},"observation_digest":"sha256:9d6925736e234e4bb8fe51e142487ea2a51542bb861e0a6968ad78e74a83be2f","observation_id":"e5e4dfcb-47a4-4f45-a5dd-578774dff898","resolution":{"observed_at":"2026-08-07T05:59:04.390203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T04:21:18.850888Z","title":"arXiv:2312.06585 [cs.LG] https://arxiv.org/abs/2312.06585","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10844","last_updated":"2025-06-12T16:02:29Z","snapshot_observed_at":"2026-08-17T00:45:52.030404Z","submitted_at":"2025-06-12T16:02:29Z","title":"CIIR@LiveRAG 2025: Optimizing Multi-Agent Retrieval Augmented Generation through Self-Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.850888Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2506.10844"},"observation_digest":"sha256:5520bff7bca8f2c087bdd74ea308dbbdbdae6d5ed69ae21aba232ce00cd86e03","observation_id":"607c30cf-eaaf-4c8f-8c72-1a6015fcdd00","resolution":{"observed_at":"2026-08-07T04:21:18.850888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-06T21:58:35.473834Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23025","last_updated":"2025-06-28T22:13:43Z","snapshot_observed_at":"2026-08-14T18:40:13.717087Z","submitted_at":"2025-06-28T22:13:43Z","title":"Spectra 1.1: Scaling Laws and Efficient Inference for Ternary Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T21:58:35.473834Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2506.23025"},"observation_digest":"sha256:cdb1eeb04cbf475093712ccaa23edc3505f7d36231f35ba5050f601066a23ce7","observation_id":"500a8237-3561-48aa-9da6-c5369e86188f","resolution":{"observed_at":"2026-08-06T21:58:35.473834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-06T15:12:01.966932Z","title":"arXiv preprint arXiv:2312.06585 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16518","last_updated":"2026-06-24T02:00:50Z","snapshot_observed_at":"2026-08-14T10:18:10.416379Z","submitted_at":"2025-07-22T12:27:08Z","title":"SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:12:01.966932Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2507.16518"},"observation_digest":"sha256:973ff176b8706878a4ad292eec5fb742282e4a3cbe940b1da6e6d9c1dd2935e9","observation_id":"60399d37-3763-4d34-9780-b5231395c56f","resolution":{"observed_at":"2026-08-06T15:12:01.966932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T16:22:50.862355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18676","last_updated":"2025-08-26T04:46:54Z","snapshot_observed_at":"2026-08-18T00:15:47.188911Z","submitted_at":"2025-08-26T04:46:54Z","title":"Utilizing Training Data to Improve LLM Reasoning for Tabular Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T16:22:50.862355Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2508.18676"},"observation_digest":"sha256:67bfa80c8d8f451bb5bc16866f21bc0aff70ee976a1cbccc42445bfffa2c306b","observation_id":"71059b91-6525-46b3-98d2-7379c09ed54a","resolution":{"observed_at":"2026-08-05T16:22:50.862355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T15:45:24.746306Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-19T14:37:57.135032Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.746306Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:7e06bb029208b4b2fafecced32198bcf74d33f6269706b495a6d396945747624","observation_id":"87b836da-7df4-457d-a007-3dbb733fc341","resolution":{"observed_at":"2026-08-05T15:45:24.746306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T13:52:52.128802Z","title":"Singh, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00271","last_updated":"2026-06-17T20:45:44Z","snapshot_observed_at":"2026-08-19T11:18:05.447017Z","submitted_at":"2025-08-29T22:56:32Z","title":"Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:52:52.128802Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2509.00271"},"observation_digest":"sha256:2362ad5f090d4bbb6d0a7926df1716b6e1ad2ca983bd9c0de5f433d44f0f6827","observation_id":"804b351d-d527-4650-a4b3-d6ec3000e6d0","resolution":{"observed_at":"2026-08-05T13:52:52.128802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-04T18:50:10.554445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09629","last_updated":"2025-09-11T17:15:45Z","snapshot_observed_at":"2026-08-14T10:55:58.245888Z","submitted_at":"2025-09-11T17:15:45Z","title":"Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T18:50:10.554445Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2509.09629"},"observation_digest":"sha256:af678ef8bec6996f24495283bd3bc4f3e4569a24b4865731fdf88ae93278151d","observation_id":"1ffe2ae4-5226-4f86-b0fb-2daf5a0086f6","resolution":{"observed_at":"2026-08-04T18:50:10.554445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-15T15:55:56.175915Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16456","last_updated":"2026-06-10T00:25:53Z","snapshot_observed_at":"2026-08-18T11:13:37.412708Z","submitted_at":"2025-09-19T22:30:23Z","title":"GPO: Learning from Critical Steps to Improve LLM Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:55:56.175915Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2509.16456"},"observation_digest":"sha256:99351000d2181f78ee8cf89b6abd1934ce45929d04cbd03048494c950f938b1c","observation_id":"890e5f64-f821-448e-8cc0-bf83393f31d0","resolution":{"observed_at":"2026-08-15T15:55:56.175915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-16T06:39:12.822315Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:13.293921Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:8caf5498e8263d7ff3fe13c3df561c70de797ffc3879456654e7557ad4866df1","observation_id":"e5abc5f4-acb5-49b1-a537-180ae38e0bbb","resolution":{"observed_at":"2026-05-21T13:14:10.981671Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-03T03:33:44.696113Z","title":"D., Agarwal, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-16T06:39:12.822315Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:44.696113Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:accf7febdbdeeec149e39b7167c4fcfcf3fca27ac310c87fc9cd06045fafef45","observation_id":"790c996a-e57a-453a-a2cc-5e7228b8c615","resolution":{"observed_at":"2026-08-03T03:33:44.696113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-03T02:43:36.662189Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10014","last_updated":"2026-05-31T19:13:22Z","snapshot_observed_at":"2026-08-15T17:40:06.025692Z","submitted_at":"2026-02-10T17:36:41Z","title":"A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:43:36.662189Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.10014"},"observation_digest":"sha256:f1139005324b958492a181b8eb0574bdf90043d01a78f5da619569dffdc58305","observation_id":"5f340510-3d13-47fd-b388-cdd51ecdeb84","resolution":{"observed_at":"2026-08-03T02:43:36.662189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T22:08:42.714880Z","title":"Srivastava, A., Rastogi, A., Rao, A., Shoeb, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17993","last_updated":"2026-07-12T00:58:22Z","snapshot_observed_at":"2026-08-07T11:22:28.223283Z","submitted_at":"2026-02-20T05:01:32Z","title":"Turbo Connection: Reasoning as Information Flow from Higher to Lower Layers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:42.714880Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.17993"},"observation_digest":"sha256:b1d08101816457dc2513610bf505ee804901e2cd8dffb5907d7f85e88d42e3d1","observation_id":"8c37dfd8-83f4-4fe2-b809-033c678ab898","resolution":{"observed_at":"2026-08-02T22:08:42.714880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2602.22507","last_updated":"2026-05-12T01:27:47Z","snapshot_observed_at":"2026-08-13T23:52:51.735661Z","submitted_at":"2026-02-26T00:54:38Z","title":"Space Syntax-guided Post-training for Residential Floor Plan Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T19:38:24.134463Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.22507"},"observation_digest":"sha256:c61f76fc878610dcc60edcca18d6a041ab1b1a965a6f45d40a81f32662c7ef82","observation_id":"924abd59-3f5f-43c1-a9ff-3d048b97ebd4","resolution":{"observed_at":"2026-05-15T19:40:17.733380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2604.18354","last_updated":"2026-04-20T14:47:50Z","snapshot_observed_at":"2026-08-13T16:29:56.153430Z","submitted_at":"2026-04-20T14:47:50Z","title":"PRISMA: Preference-Reinforced Self-Training Approach for Interpretable Emotionally Intelligent Negotiation Dialogues","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T05:00:26.238268Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2604.18354"},"observation_digest":"sha256:670661166e60e8c9c954fa22e7676c3f745f5aced3b181ac6f987ac1633b19f5","observation_id":"c391cbcd-6896-4f3d-856f-c02b0e90f75a","resolution":{"observed_at":"2026-05-10T10:14:10.818457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-08-11T06:12:59.324541Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T15:08:53.731480Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:beb8daa46fd733fb4281fad72c12e0406c66cf0f3728da82510d095f66813032","observation_id":"734bac73-6aee-4772-a492-e877d7328eae","resolution":{"observed_at":"2026-05-11T16:46:06.930542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-08-11T06:12:59.324541Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T00:48:54.797750Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:527f059320c0c26b0087d6b84a540d04698073483d3a535bafa85812a237c819","observation_id":"af2a7b0e-a535-4cb4-814f-64525ee14ee4","resolution":{"observed_at":"2026-07-01T00:55:12.106795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.01327","last_updated":"2026-05-07T08:09:44Z","snapshot_observed_at":"2026-08-13T01:17:32.478140Z","submitted_at":"2026-05-02T08:47:45Z","title":"Segment-Aligned Policy Optimization for Multi-Modal Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T14:44:31.160543Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.01327"},"observation_digest":"sha256:101e00b92b312f722a57568a071fdfc794df8e5c675cb37fd2232a0d8c38ad6a","observation_id":"83deb363-64c7-4970-958d-fc6bd40d1a98","resolution":{"observed_at":"2026-05-11T16:51:07.861678Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-08-22T09:58:59.632087Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-08T09:53:32.077464Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.06650"},"observation_digest":"sha256:9918e406dac384ba78d0d5c1ddcb8b32fb79b5ddc85decff4dcbb5f2140737b7","observation_id":"b8c432ad-a1c4-4228-8f84-5e9a210351c7","resolution":{"observed_at":"2026-05-11T20:16:08.428351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-16T16:24:07.331889Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:cc62d2e16a80d2cf1cdab47113d190e1187c3509ea8a82d8ead72dc67ed95ab6","observation_id":"4df2d3ef-ea52-4954-ac9b-091668ef48f3","resolution":{"observed_at":"2026-05-21T11:24:08.738134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-08-16T08:27:48.541150Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T05:38:26.590720Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:641d683c92f84da7ff3a46c22062ed9f913dcc1d9d3bf500b3332e6f3d473028","observation_id":"2d8e60a0-23ff-491b-888b-6e971a037740","resolution":{"observed_at":"2026-05-21T05:39:40.598262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-08-16T08:27:48.541150Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T17:19:09.596950Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:c301d552c86b71025885f90a2fe14e4873c0b8586efe5e5871b2602bc4474e1d","observation_id":"7fbeceff-a5d9-481c-975e-d297f43c2bed","resolution":{"observed_at":"2026-06-30T17:24:57.549368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.22675","last_updated":"2026-05-21T16:18:41Z","snapshot_observed_at":"2026-08-20T21:23:34.321743Z","submitted_at":"2026-05-21T16:18:41Z","title":"Self-Policy Distillation via Capability-Selective Subspace Projection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T05:31:42.803465Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.22675"},"observation_digest":"sha256:8736a6de8f40f6f7e3ceb975e55a9b66873186807f986a0fa56d03f7fdfa1afa","observation_id":"66f7a843-37d7-49f4-bd12-4b296193d4ae","resolution":{"observed_at":"2026-05-22T05:34:40.416173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.26037","last_updated":"2026-05-25T17:05:35Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T17:05:35Z","title":"Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T21:20:16.027196Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.26037"},"observation_digest":"sha256:3ecc41d54f7407db2cbf3af475107337face734eeb4095256e9f3e09134fa202","observation_id":"5eb8abed-a77d-444c-800a-cad6063f909a","resolution":{"observed_at":"2026-06-29T21:23:58.942626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.31455","last_updated":"2026-05-29T15:49:13Z","snapshot_observed_at":"2026-08-06T06:42:59.945235Z","submitted_at":"2026-05-29T15:49:13Z","title":"DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:49.358792Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.31455"},"observation_digest":"sha256:57250ff545d3efac5f751aa49c26ba9d4ac2fcecee8b840128fb534e5947291e","observation_id":"162d4ffc-93b7-43b0-9ec3-d2daf9973525","resolution":{"observed_at":"2026-06-29T00:02:50.297157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.00628","last_updated":"2026-05-30T09:03:03Z","snapshot_observed_at":"2026-08-03T17:14:51.636270Z","submitted_at":"2026-05-30T09:03:03Z","title":"Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T19:12:39.939329Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.00628"},"observation_digest":"sha256:17118e6608e976cd818640bf3d423b80d20e6be9355fa0a32fa878dec8dd172a","observation_id":"b1ad4b1d-ebb2-4778-83a0-a03e9fe21758","resolution":{"observed_at":"2026-06-28T19:22:35.025991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.05464","last_updated":"2026-06-03T21:43:38Z","snapshot_observed_at":"2026-08-03T10:19:08.677126Z","submitted_at":"2026-06-03T21:43:38Z","title":"Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T05:46:26.938277Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.05464"},"observation_digest":"sha256:3b3365f0dff16ae000e28819a3f6a3d84058a90b08caf5455b4031c36fd348e4","observation_id":"71a6711c-6d6e-4d83-8eba-186cf78d6b44","resolution":{"observed_at":"2026-07-02T08:46:48.965970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:f2f0e8f91eab8df46f892a971dd3e76de175ed62a3aebe8436a41a607cb37494","observation_id":"667f03c4-2391-4a3c-bcd0-3a76d4a86077","resolution":{"observed_at":"2026-07-03T20:48:56.134444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.18307","last_updated":"2026-06-16T07:21:49Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T07:21:49Z","title":"DRIFT: Refining Instruction Data via On-Policy Data Attribution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T01:57:05.784589Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.18307"},"observation_digest":"sha256:9843bf9d35aaf0b96658329a34b19ed9890d15eee1143aee87b552edb832f76e","observation_id":"e3ccd73e-cf5c-42c6-8855-488529460e81","resolution":{"observed_at":"2026-07-03T19:18:54.719160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.23611","last_updated":"2026-06-22T17:11:15Z","snapshot_observed_at":"2026-08-12T13:39:08.360008Z","submitted_at":"2026-06-22T17:11:15Z","title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:47.537137Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.23611"},"observation_digest":"sha256:b368e625c7874809467c47251ca017973d0458327b5df65e0ba809b1be3572aa","observation_id":"f8137536-2793-4e73-828e-8f691d7d3b6d","resolution":{"observed_at":"2026-07-04T09:49:44.969512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-10T18:32:18.583804Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:bf196bf2943f70ef29580d61ad791f48cc989066c20e9c09fc4b56419c7c8dae","observation_id":"dcf81913-45a8-4a5f-bf89-88c9345346a9","resolution":{"observed_at":"2026-07-04T21:00:08.422731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.27373","last_updated":"2026-06-25T17:59:55Z","snapshot_observed_at":"2026-08-08T23:29:13.406265Z","submitted_at":"2026-06-25T17:59:55Z","title":"Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T05:01:47.207296Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.27373"},"observation_digest":"sha256:07a0de795645624a0d2d8cfa4cf3ab32db999c397e397d13adf0b23afaf2aa6a","observation_id":"c88cb04e-be10-40ae-bda7-3e86ffdc71c1","resolution":{"observed_at":"2026-07-04T13:39:50.967732Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.29340","last_updated":"2026-06-28T11:15:26Z","snapshot_observed_at":"2026-08-08T00:55:58.041882Z","submitted_at":"2026-06-28T11:15:26Z","title":"PHF: Privileged Hidden Flow for On-Policy Self-Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-30T07:26:32.902086Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.29340"},"observation_digest":"sha256:4c45f44d81c063707548178e56fa900cfd68c2cfd73438b076bf3c719bdacab7","observation_id":"6cb802be-2f28-43ef-a056-6c9296fdc956","resolution":{"observed_at":"2026-06-30T07:34:21.811633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2607.00531","last_updated":"2026-07-01T07:22:46Z","snapshot_observed_at":"2026-08-13T09:07:12.314050Z","submitted_at":"2026-07-01T07:22:46Z","title":"Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-02T16:07:49.362916Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.00531"},"observation_digest":"sha256:ef615fecc16415a8dfc9274ef4b399a1918c178a1e229fac7b001054bf770d3a","observation_id":"bd21824f-69a1-4582-8962-2589159d7811","resolution":{"observed_at":"2026-07-02T16:17:08.604206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":205,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3a021538c9e0ae613420397d5c2c71c73f7314396b09015ecb5dd8a0744bb20c","observation_id":"90ab09a6-18ef-4af7-bb5b-b663d1979ec4","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T08:40:56.405118Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:56.405118Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:86d27cf17599c73423217cfe8a6f2a77be1d049cc617efc174b5626866637428","observation_id":"a5c001a8-f646-4831-b290-bdd4ceadd008","resolution":{"observed_at":"2026-08-02T08:40:56.405118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-14T17:25:37.713857Z","title":"Co-Reyes, Rishabh Agarwal, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09709","last_updated":"2026-06-23T13:47:41Z","snapshot_observed_at":"2026-08-16T21:30:04.101199Z","submitted_at":"2026-06-23T13:47:41Z","title":"The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T17:25:37.713857Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.09709"},"observation_digest":"sha256:4dea1c527d8729fc976c472d5f4938167b56c728f4da6772a6b054235abb8ebe","observation_id":"2d3c46f9-bc77-4557-bd9f-699103e384a7","resolution":{"observed_at":"2026-07-14T17:25:37.713857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-20T06:50:44.998850Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:1707989de1c4d8d4f72ab70c01515a82a186d93e905b49c4ed3c37210e2aaaa4","observation_id":"13dd479b-e987-4d72-adad-948b0c3a7dfb","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T03:56:26.701252Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13753","last_updated":"2026-07-20T09:24:51Z","snapshot_observed_at":"2026-08-18T06:32:28.189113Z","submitted_at":"2026-07-15T12:12:37Z","title":"Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration","version":2},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-02T03:56:26.701252Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.13753"},"observation_digest":"sha256:da83a4df0cb308d88392f331196074d0efec526ac29c39c6f9925bea2c3cd4ce","observation_id":"e0ff153d-3cab-4e56-aead-9b7e7bd48a79","resolution":{"observed_at":"2026-08-02T03:56:26.701252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T01:52:28.936526Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14552","last_updated":"2026-07-16T04:28:19Z","snapshot_observed_at":"2026-08-15T06:42:39.717073Z","submitted_at":"2026-07-16T04:28:19Z","title":"Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T01:52:28.936526Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.14552"},"observation_digest":"sha256:44ef27596f97f734f5bb482e8370b497de023befeda77f4999efb650245c38d4","observation_id":"d1620c7f-8ad5-43ff-bc27-7b2489a9d2b6","resolution":{"observed_at":"2026-08-02T01:52:28.936526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T01:15:33.669821Z","title":"Transactions on Machine Learning Research (2024), https: //arxiv.org/abs/2312.06585","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14735","last_updated":"2026-07-16T09:01:02Z","snapshot_observed_at":"2026-08-15T20:38:04.629309Z","submitted_at":"2026-07-16T09:01:02Z","title":"CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:33.669821Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.14735"},"observation_digest":"sha256:fb333089eba9ff77e58e0029a94e66f2fa2f59cecf1c99dc3ac08f188a28bd71","observation_id":"f75ed8b3-e8bc-4b2e-9605-2afc67667824","resolution":{"observed_at":"2026-08-02T01:15:33.669821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-01T12:54:34.843879Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-12T20:21:39.140409Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:34.843879Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:296527ea110d33fc1eb7460ae58efdc70a50c51aa296a7141c27562d971b6535","observation_id":"8601a47d-6b23-4ca9-8ba9-1fc876d16795","resolution":{"observed_at":"2026-08-01T12:54:34.843879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T13:32:13.493804Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19354","last_updated":"2026-05-21T18:09:33Z","snapshot_observed_at":"2026-08-19T16:55:46.920860Z","submitted_at":"2026-05-21T18:09:33Z","title":"FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T13:32:13.493804Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.19354"},"observation_digest":"sha256:72b6a62097b59ac95c4967bb30209757bb014db5e32a8a6af5307a5a21ab27fa","observation_id":"0be574e1-6fbf-4c6b-96a8-61d630984dcf","resolution":{"observed_at":"2026-08-02T13:32:13.493804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-01T03:02:08.797292Z","title":"and Agarwal, Rishabh and Anand, Ankesh and Patil, Piyush and Garcia, Xavier and Liu, Peter J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":171,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:08.797292Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:56b2339610b4bf591c7c8dfd82d8b5d1233b8de4316e7df73fcee8618419bcc2","observation_id":"05e6d4e8-23ee-4cdc-b797-a7c0281ffebe","resolution":{"observed_at":"2026-08-01T03:02:08.797292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-31T22:51:49.392233Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27937","last_updated":"2026-07-30T09:47:58Z","snapshot_observed_at":"2026-08-19T17:08:20.546820Z","submitted_at":"2026-07-30T09:47:58Z","title":"From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T22:51:49.392233Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.27937"},"observation_digest":"sha256:256f21ce9b335b00b1f45d80e5a9074425843e5e7417f7c78d2a226c38155fec","observation_id":"8f08c263-545e-4637-b701-934097b26025","resolution":{"observed_at":"2026-07-31T22:51:49.392233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-08T12:35:01.459919Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05466","last_updated":"2026-08-12T19:28:42Z","snapshot_observed_at":"2026-08-20T11:17:32.203910Z","submitted_at":"2026-08-05T23:24:26Z","title":"Recursive Synthesis for Long-Horizon Terminal Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:35:01.459919Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2608.05466"},"observation_digest":"sha256:2f6e44e944be9c61a238cfe5fd77a4b6e625c1674a30d6cbeefb4f79c6b16fa2","observation_id":"c2689870-d8ac-4522-a585-d2f1e16e5a9b","resolution":{"observed_at":"2026-08-08T12:35:01.459919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-10T04:31:42.362344Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05466","last_updated":"2026-08-12T19:28:42Z","snapshot_observed_at":"2026-08-20T11:17:32.203910Z","submitted_at":"2026-08-05T23:24:26Z","title":"Recursive Synthesis for Long-Horizon Terminal Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T04:31:42.362344Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2608.05466"},"observation_digest":"sha256:d42e2dd3174d7735c7ae6821e39e0150040111b9fee42a3a61cf86795a7049b7","observation_id":"5e6c19ce-8f43-4cca-8b91-8acaebf75c24","resolution":{"observed_at":"2026-08-10T04:31:42.362344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-12T14:10:45.595055Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10928","last_updated":"2026-08-11T13:58:07Z","snapshot_observed_at":"2026-08-17T15:17:05.825896Z","submitted_at":"2026-08-11T13:58:07Z","title":"ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-12T14:10:45.595055Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2608.10928"},"observation_digest":"sha256:dad9bce5599eb4b71c191a00007c8edd6c8b6eaf351f2dfc81a3de0c6325474e","observation_id":"c35085c4-e018-450c-96f8-9517ab8c39cb","resolution":{"observed_at":"2026-08-12T14:10:45.595055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.06585/citation-record","integrity":"/paper/2312.06585/integrity","json":"/paper/2312.06585/citation-record.json","paper":"/paper/2312.06585"},"outbound":[],"paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 85 inbound Pith citation observations for arXiv:2312.06585."}