{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78a60df3ca38b8294ea79df57c892e7ea38b45391fefaad17e1ff3bb49f21a8b","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:27:51.188077Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:18:54.669121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2502.06781","doi":"10.48550/arxiv.2502.06781","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":"ArXiv.org","work_id":"48208898-31bc-4742-a673-7b6a4d77d027","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:b0ca28f76b3ca6d817bf06d5b102b49dd0b6818f87e2662fffb80716b73f50f0","observation_id":"40a1032b-0f5d-4e52-8a77-687f5ff1de13","resolution":{"observed_at":"2026-05-22T19:32:01.345899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T15:18:54.669121Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-09T17:44:56.423478Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:54.669121Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2505.15791"},"observation_digest":"sha256:097535cf56e76198be54670ce206ab5347ba8fa76c2da83d703c291a04668a79","observation_id":"6a317298-8807-4244-bf64-974ce588f354","resolution":{"observed_at":"2026-08-07T15:18:54.669121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T14:10:12.939491Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-09T12:04:53.981130Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.939491Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:e6c9c23bc061fd05dd4758ea453319faef22fa560513ad56b9917bdd61de2e40","observation_id":"04b7eaec-cacb-4cbb-85b3-b00ad11efe56","resolution":{"observed_at":"2026-08-07T14:10:12.939491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T12:40:09.933663Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.arXiv preprint arXiv:2502.06781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24105","last_updated":"2025-05-30T01:13:22Z","snapshot_observed_at":"2026-08-09T13:46:57.143129Z","submitted_at":"2025-05-30T01:13:22Z","title":"Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:09.933663Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2505.24105"},"observation_digest":"sha256:8f6facb46b714e20a8f805df45f4021f58aad7aad53d23ff924e6ad3f1015f30","observation_id":"747e0839-1ec3-49c4-b4f8-1e95d895c7b6","resolution":{"observed_at":"2026-08-07T12:40:09.933663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T11:32:31.527587Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.arXiv preprint arXiv:2502.06781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-09T00:47:31.746531Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:31.527587Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:13c4936f2601902a442517e935912f42e7da1fb2cae26b8354ef20e2650e36e9","observation_id":"867e3e6f-9b30-47c1-b77b-cd076a11bcef","resolution":{"observed_at":"2026-08-07T11:32:31.527587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T05:09:44.200132Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-08T00:32:04.126170Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.200132Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:213ed321a0ce49f4b066095e7c836b3945ea85f0b6511cd65d5d31c7350f3d95","observation_id":"59a01924-d375-4698-afa9-7e01cd44e84c","resolution":{"observed_at":"2026-08-07T05:09:44.200132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-06T21:55:01.685340Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-09T05:53:21.859449Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.685340Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:e025de49491fd12a8a7be694008808cccf6d1f73b69030f0708a36d4424c5e04","observation_id":"69dcfd01-d48e-4d21-85dd-be3372de2929","resolution":{"observed_at":"2026-08-06T21:55:01.685340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-06T20:46:44.783885Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-10T04:39:01.641296Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.783885Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:2f06d28aa722cff0c6deb86d41b71d5c4b10f343bae2795db928355ea474d3d9","observation_id":"1845ae5b-eaf4-43c4-a421-8b0b14f25fd2","resolution":{"observed_at":"2026-08-06T20:46:44.783885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-06T19:59:28.348022Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.arXiv preprint arXiv:2502.06781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-08T15:50:06.172618Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:28.348022Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2507.04136"},"observation_digest":"sha256:549080b68088afd1e5f318625341178686bbd3de6b37ac5487e2229aff9c7983","observation_id":"9d18271c-db52-48d0-a8b3-0f038b000880","resolution":{"observed_at":"2026-08-06T19:59:28.348022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-06T14:13:06.979201Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:06.979201Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:33d1cdbb7762f56500273562f46ab37236e833ea0e79f015815b5ec3d7e3be6c","observation_id":"40207b04-b788-474d-8ee3-8edcf2b3f3de","resolution":{"observed_at":"2026-08-06T14:13:06.979201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-05T20:21:08.144794Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.CoRR, abs/2502.06781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.144794Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:327488c83980d1ed96ec7cb52c63836d71a48d2310c92cedf535d18bc7aed587","observation_id":"9eaa3cc7-49dd-4760-9e89-0b0c97512861","resolution":{"observed_at":"2026-08-05T20:21:08.144794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-05T15:11:01.093701Z","title":"arXiv:2502.06781","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20384","last_updated":"2025-08-28T03:16:15Z","snapshot_observed_at":"2026-08-09T05:47:43.660397Z","submitted_at":"2025-08-28T03:16:15Z","title":"Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:11:01.093701Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2508.20384"},"observation_digest":"sha256:23a6937249f5504906bc611c36ef97ed95356e92330aa1b940da1d2ba785d00d","observation_id":"36284a2e-89b8-4e03-ac8a-75c39a212196","resolution":{"observed_at":"2026-08-05T15:11:01.093701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-04T06:40:24.891449Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.arXiv preprint arXiv:2502.06781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10739","last_updated":"2026-08-03T08:17:50Z","snapshot_observed_at":"2026-08-07T08:51:03.458621Z","submitted_at":"2025-12-11T15:26:28Z","title":"Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T06:40:24.891449Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2512.10739"},"observation_digest":"sha256:746d49ffb7dece3f63e1589a7ad0a9ee3b71c00a2bb498fa3825832e769d412c","observation_id":"da937472-cdc1-490a-beb9-4b79cd4fbc57","resolution":{"observed_at":"2026-08-04T06:40:24.891449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-03T03:04:43.981554Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.arXiv preprint arXiv:2502.06781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.981554Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:a93f44a3b959260e8c999a918b0573187be80b327acec1c518e72159a544f5ff","observation_id":"cc15766a-f859-4eaa-9b3b-82060a08db9c","resolution":{"observed_at":"2026-08-03T03:04:43.981554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2502.06781","doi":"10.48550/arxiv.2502.06781","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":"ArXiv.org","work_id":"48208898-31bc-4742-a673-7b6a4d77d027","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":224,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:c5d23f8601567785f3d9bec1c34d5a08b06c7f36c45ab0612962e667868b5464","observation_id":"6e7d4cec-4529-43b9-bac8-67b44a0416a9","resolution":{"observed_at":"2026-07-01T20:56:13.534551Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2502.06781","doi":"10.48550/arxiv.2502.06781","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":"ArXiv.org","work_id":"48208898-31bc-4742-a673-7b6a4d77d027","year":2025},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:f551bcd9560ff26e5746e4dbbcf8ea3c3ab83805905eb8459819558353616699","observation_id":"7bc710db-20a8-4c95-a0e0-c252eb3cb39f","resolution":{"observed_at":"2026-06-27T13:00:56.109782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06781/citation-record","integrity":"/paper/2502.06781/integrity","json":"/paper/2502.06781/citation-record.json","paper":"/paper/2502.06781"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-08T14:27:50.952069Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.952069Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:b1e9dc01ebf61323d69213fa17a9bf58cfa90414a0df9a6dbf5e04e3c80342a1","observation_id":"070b2498-fd8a-4ebf-8468-bee490322b3e","resolution":{"observed_at":"2026-08-08T14:27:50.952069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:50.956292Z","title":"Evaluation of openai o1: Opportunities and challenges of agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.956292Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:49b2b93105496b348795c1b61b7ce812d253a0be13a4e37e1cb12f8cfb910c49","observation_id":"00f685af-9b48-416e-b41c-e48ce97c90f6","resolution":{"observed_at":"2026-08-08T14:27:50.956292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07622","last_updated":"2025-01-01T08:16:41Z","snapshot_observed_at":"2026-08-09T17:45:06.868441Z","submitted_at":"2023-12-12T01:39:16Z","title":"Mathematical Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07622","snapshot_observed_at":"2026-08-08T14:27:50.960542Z","title":"Mathematical language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.960542Z"},"links":{"cited_paper":"/paper/2312.07622","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:712ddfeacf96914f96d3775382fabbbdc609a3635b7532e70410314b96915b11","observation_id":"e75f2754-1033-4cd8-b473-c3f72e91c319","resolution":{"observed_at":"2026-08-08T14:27:50.960542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.960365Z","title":"Learning mathematics with large language models: A comparative study with computer algebra systems and other tools","venue":null,"work_id":"16d52a1d-90b1-4865-852a-f87ac9540af2","year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.964513Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:1831cc7a841de12dac998796e9ed4e003f6251b70b394d1ca8d9ead3384f11fa","observation_id":"1d04e19b-9ea1-46b8-8400-d2cdbabb70e5","resolution":{"observed_at":"2026-08-08T14:27:51.964175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06332","last_updated":"2024-05-24T07:09:21Z","snapshot_observed_at":"2026-08-10T07:06:15.150032Z","submitted_at":"2024-02-09T11:22:08Z","title":"InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06332","snapshot_observed_at":"2026-08-08T14:27:50.968094Z","title":"Internlm-math: Open math large language models toward verifiable reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.968094Z"},"links":{"cited_paper":"/paper/2402.06332","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:5c8670f7ad9f54dba23c73c73b0a4d9e1c68c6625ca3dcd2118331687b71de29","observation_id":"dd449979-713d-4581-a4a4-02df42ae17fb","resolution":{"observed_at":"2026-08-08T14:27:50.968094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T14:27:50.971842Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.971842Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:61087239771ff6077890f5efe39b964012dbf81ff80a4be6321490c19b1120c1","observation_id":"a579b9ce-63bc-4d3a-9636-af3be8dea892","resolution":{"observed_at":"2026-08-08T14:27:50.971842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:50.976015Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.976015Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:b0955eb5ea37e59e63ceb97f129c783ffd64e5b8e86caafad70c3c9937459916","observation_id":"629ab2a0-7625-4222-95cd-2447f843433c","resolution":{"observed_at":"2026-08-08T14:27:50.976015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-08T14:27:50.979230Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.979230Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:f5fbb58cd07589a59e23a17c60c6374b77988a70005718e9cd58c936b351632b","observation_id":"1ff782f0-5b4d-4fae-b51b-d1721b242208","resolution":{"observed_at":"2026-08-08T14:27:50.979230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.945004Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"a4a184f2-4308-4b9c-a16f-dd358b0c74b1","year":2022},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.982287Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:bd7bb8746e1e04486766a856c355d257146073b645ba4ddfab2fd8a0cec80a7c","observation_id":"d630a42d-af51-475d-86af-69e9aa1d0d52","resolution":{"observed_at":"2026-08-08T14:27:51.948597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:50.985001Z","title":"Learning to reason with llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.985001Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:be6c2760a157534ebb70bde778641387105e8c1de0dde202ab703e2071a7eb7f","observation_id":"8e5601dd-0f1a-4b45-ae29-df4c0c3fbd2d","resolution":{"observed_at":"2026-08-08T14:27:50.985001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-08T14:27:50.987846Z","title":"O1 replication journey–part 2: Surpassing o1-preview through simple distillation, big progress or bitter lesson? arXiv preprint arXiv:2411.16489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.987846Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:866ac5f5e6ee878226b9b94f0720e84687912c3913086b920e2ad2c2a62751fe","observation_id":"199ead34-9050-4d22-a51a-9b03c6f5914e","resolution":{"observed_at":"2026-08-08T14:27:50.987846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-08T14:27:50.990868Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.990868Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:93e3efe5f20f91b8ca39e61de6c61063ae5892244d60b032aa8c1123064dd821","observation_id":"871245c2-a6a3-493c-a54d-f99196ba7204","resolution":{"observed_at":"2026-08-08T14:27:50.990868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:50.993788Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.993788Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:8a709d78ed73025a3968942d753050051e614a96392b432729c6bb7a23393ee8","observation_id":"2ce37bdf-1627-42da-af54-cbfded59f731","resolution":{"observed_at":"2026-08-08T14:27:50.993788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-08T14:27:50.997289Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:50.997289Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:3dcd3ff6f8bae9379599179ad0953d28012133353bf0e3099a574e3589c261c0","observation_id":"292779e5-b639-4409-a57b-e2699deb09de","resolution":{"observed_at":"2026-08-08T14:27:50.997289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T14:27:51.000656Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.000656Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:7398a2f12152b3f31851539877a0cc5085fea187e2335cbf6be6f44de9257ee0","observation_id":"e2c1c0a8-5866-4a2f-9cb5-ad6154e5b334","resolution":{"observed_at":"2026-08-08T14:27:51.000656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-08T14:27:51.004122Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.004122Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:a6ea23a119b2384f72f37337b381a308d6a1a92a4bcc07f5106b8eaac19ed75a","observation_id":"4e36297a-2947-4184-a310-4a514ddaf916","resolution":{"observed_at":"2026-08-08T14:27:51.004122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.923694Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"a30bd3ea-b22e-4a4b-a474-637416ecf256","year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.007499Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:2455d9433ac33404d58fa5f4b5e34d62f47fb906fe2a05a2a2fef429edc82f08","observation_id":"8d9ae74e-9211-4336-bafe-8df79ea40d07","resolution":{"observed_at":"2026-08-08T14:27:51.927158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-08T14:27:51.010658Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.010658Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:34dd530185dcf69fdaf41ade3ea971a49eb32085b93bd9e66b9a85af8133a7ee","observation_id":"f8d070c7-893d-42df-86e7-3ed7693068de","resolution":{"observed_at":"2026-08-08T14:27:51.010658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T14:27:51.014567Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.014567Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:ae08fe8318e728fe23fd9af450748f31f555e766e531e53e93a2450a159c15c1","observation_id":"be090f1b-f199-43b0-baa9-6fbb70e31602","resolution":{"observed_at":"2026-08-08T14:27:51.014567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-08T14:27:51.017933Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.017933Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:5d8cf0369c7264bf73684e4a041df2bef71db25b77a778660a67dbf3b0847a88","observation_id":"2006b791-2a83-49d0-a968-4226a286814b","resolution":{"observed_at":"2026-08-08T14:27:51.017933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-08T14:27:51.021439Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.021439Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:0becbb5204844881b20501ea0620f279768eaad36d3fdcfc06e3c5de5d7a76b1","observation_id":"64d9f09a-5f85-4fa4-88eb-10ec2f19afda","resolution":{"observed_at":"2026-08-08T14:27:51.021439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.024829Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.024829Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:6615a38e819615d23fea1d028fe69020286594ca696969ecbf35c047ffd138bd","observation_id":"42494796-eabd-435e-9f73-f74ef2ad5a6c","resolution":{"observed_at":"2026-08-08T14:27:51.024829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-08T14:27:51.027795Z","title":"Scaling relationship on learning mathematical reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.027795Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:c9868548625ad9b0ba7d439a5b7b488e6a19cb7176bf6d0f0e675e9dd7d13f5d","observation_id":"536d2d7d-acf4-4146-b2a1-09b8dfec53c0","resolution":{"observed_at":"2026-08-08T14:27:51.027795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.031167Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.031167Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:ad6e473888486745a0eaef73e9bd7b7f950ba3f628665d1de0b86d9203b35fe1","observation_id":"e4969442-85fa-4f68-a47d-b11989dcd6b3","resolution":{"observed_at":"2026-08-08T14:27:51.031167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13011","last_updated":"2024-03-14T18:07:10Z","snapshot_observed_at":"2026-08-08T21:55:02.376282Z","submitted_at":"2023-10-17T01:31:59Z","title":"Compositional preference models for aligning LMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13011","snapshot_observed_at":"2026-08-08T14:27:51.034371Z","title":"Compositional preference models for aligning lms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.034371Z"},"links":{"cited_paper":"/paper/2310.13011","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:32015878f42cd82303021263c275cccdcc9d4e0a85a8986472aa0b94452b9886","observation_id":"9b12b849-774d-42cf-9696-0417cfc1e1a3","resolution":{"observed_at":"2026-08-08T14:27:51.034371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-08T14:27:51.037751Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.037751Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:cb636593dda755425283702ef781ca2ce0d48373dabee0451736b581426aed54","observation_id":"936b6233-ed02-4f62-887d-7961a625bba4","resolution":{"observed_at":"2026-08-08T14:27:51.037751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.041315Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.041315Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:427fc9bf9b37aa1e1c095ea4942bb914c6e3c521348c413b5722832ab2a1bd9c","observation_id":"b0a1e810-bdc1-43c1-9dbe-8c19308aea81","resolution":{"observed_at":"2026-08-08T14:27:51.041315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.896561Z","title":"Measuring goodhart’s law","venue":null,"work_id":"2165f1f8-e31d-4b69-8939-26369e040c7f","year":2022},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.044512Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:9685c2170ef1fe3da9bf9b8e05d4bd16f7100de57ec8d3c099ea8c8a6c3d9fad","observation_id":"60363d63-ef52-40a2-9268-446c007979b5","resolution":{"observed_at":"2026-08-08T14:27:51.899764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16755","last_updated":"2024-02-22T22:29:10Z","snapshot_observed_at":"2026-07-06T15:09:36.509406Z","submitted_at":"2023-03-28T17:04:15Z","title":"Training Language Models with Language Feedback at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16755","snapshot_observed_at":"2026-08-08T14:27:51.047668Z","title":"Training language models with language feedback at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.047668Z"},"links":{"cited_paper":"/paper/2303.16755","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:848f6444d2de915797663afc511b2b47874088cf8d8f44776c53fbb45dc3b9e8","observation_id":"a7892b10-f28a-4cf0-92e0-b61c143dd331","resolution":{"observed_at":"2026-08-08T14:27:51.047668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-08T14:27:51.051139Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.051139Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:96be2e3b381db90a765144310b6e252bf1fefc0a76d115b8c8df9c3b4b0b09fd","observation_id":"0c3fe5c1-4a8a-434b-865d-c3999a37b8c8","resolution":{"observed_at":"2026-08-08T14:27:51.051139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-04T16:20:42.997639Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-08T14:27:51.054553Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.054553Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:17b331db02ade5ab6ebbda3efb44bbf1a9c886b36cb362c2e03fa4f6ac5f7760","observation_id":"9d9880a1-80ff-40c3-bc4f-2f9990694c83","resolution":{"observed_at":"2026-08-08T14:27:51.054553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-08-10T04:20:06.578723Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-08-08T14:27:51.057910Z","title":"Bond: Aligning llms with best-of-n distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.057910Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:0d99053bbc5ceba5d56e5e8543dce763aac941faea2fc752527ef1e245d82ad3","observation_id":"1d2dd4b9-7af2-4202-8fcf-f2333aee9d00","resolution":{"observed_at":"2026-08-08T14:27:51.057910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.887191Z","title":"An invariant form for the prior probability in estimation problems.Proceedings of the Royal Society of London","venue":null,"work_id":"99d192ef-ee53-407e-9389-d71623e7df15","year":1946},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.060751Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:4fd524c02ae71b275e985a06e8f39d68056eed8399b46c3d61c6e16aabdee695","observation_id":"761dece5-630e-4bd8-bafa-bbba8fe28237","resolution":{"observed_at":"2026-08-08T14:27:51.890501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.063480Z","title":"Inference-aware fine-tuning for best-of-n sampling in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.063480Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:1fdcc5946f1250484d9d086814d87ef8821c2367e08914f82b88a85dcbc5b945","observation_id":"829da88e-2bc1-4430-90a8-52240aabd898","resolution":{"observed_at":"2026-08-08T14:27:51.063480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.878265Z","title":null,"venue":null,"work_id":"f366d79e-c346-4a08-9636-baeee4fa2410","year":1989},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.066461Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:92b1b5c6fa5cf34a830ae77fc90460eb61401bddf8b94d611bef89e123a57247","observation_id":"1c87d03d-98d3-4564-8e75-04f06a18433d","resolution":{"observed_at":"2026-08-08T14:27:51.881237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-08T14:27:51.069301Z","title":"From r to Q*: Your language model is secretly a q-function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.069301Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:c304ecc057d1252c4c8471e9f6b8a7131dca6d24b480e98bea07ca3a1521547b","observation_id":"490b5225-c7e4-49b7-bef9-f6842dca9f64","resolution":{"observed_at":"2026-08-08T14:27:51.069301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14874","last_updated":"2024-08-29T13:49:40Z","snapshot_observed_at":"2026-08-04T11:23:05.310181Z","submitted_at":"2024-08-27T08:43:32Z","title":"Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data","version":2},"cited_work":{"arxiv_id":"2408.14874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14874","snapshot_observed_at":"2026-08-08T14:27:51.348717Z","title":"Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data","venue":"cs.CL","work_id":"5cfd4922-dc30-44ec-8029-62b3af2ee01a","year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.072172Z"},"links":{"cited_paper":"/paper/2408.14874","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:3f4fe3242a6387d0c57731079eae8d567e020c8acb6d46834a60e3eed50aa258","observation_id":"ef4dc255-3e0b-4c4f-8de8-5f10a5aa7577","resolution":{"observed_at":"2026-08-08T14:27:51.354494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T14:27:51.075427Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.075427Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:dce448e3e7da137c4fd1bb740191c09a7ad785871caa7391b9c739d4ffd99c60","observation_id":"b5ba40e0-c1a8-47d0-8eec-f3445f4f1487","resolution":{"observed_at":"2026-08-08T14:27:51.075427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-08T14:27:51.079089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.079089Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:070612bd54c3131782fd903934caa22ea1ccb3b927d36394a6601e0df079b496","observation_id":"21c39724-a36f-4aff-aff7-5cf6d8cc758b","resolution":{"observed_at":"2026-08-08T14:27:51.079089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.868819Z","title":"Opendatalab: Empowering general artificial intelligence with open datasets, 2024","venue":null,"work_id":"70872e41-c8b7-4b95-bd9f-ed1a81eb0786","year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.082523Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:1390740d598d0195cf7b3acc68af41f42da6e517fd18727ff52437d470e0de3d","observation_id":"ac75e7e4-c444-4646-8d66-1dac7bdbfad3","resolution":{"observed_at":"2026-08-08T14:27:51.872242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.085801Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13:9, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.085801Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:7bf44552913190dd885d867bab775ed96c427fd9996d0fee48fb6dfe04856143","observation_id":"d591aa9a-08ca-4501-89e3-220a28935053","resolution":{"observed_at":"2026-08-08T14:27:51.085801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.088874Z","title":"Hello GPT-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.088874Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:b45f9c63050671016bf70ec874f23966ead252fb4fe669f3ced1f3305639ba50","observation_id":"5a5c329a-4708-48b6-97c2-01a298ccd552","resolution":{"observed_at":"2026-08-08T14:27:51.088874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.092448Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.092448Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:5e29fa270b5245058abf9a848c5eb828a1bf4bbbae431156da38811d18159631","observation_id":"42c59246-87cd-4843-af78-27b2e239b241","resolution":{"observed_at":"2026-08-08T14:27:51.092448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.841266Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient","venue":null,"work_id":"67a8d2e6-d028-45ae-841f-0dbdd5f8bef0","year":2025},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.095867Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:ccf11b88f88e566b362d26bd6e1402872e75770b3fd9ccea9ed27951640adf63","observation_id":"338d44e4-3e74-495e-8e48-25503ca63927","resolution":{"observed_at":"2026-08-08T14:27:51.845013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-08T14:27:51.099046Z","title":"rstar-math: Small llms can master math reasoning with self-evolved deep thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.099046Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:e0329641e8895faa7d9334f59cd4f46ef3bb32028acdce5adccffe1a0ea834fe","observation_id":"1593a911-7d7b-4aa5-ba85-16fd0f66797b","resolution":{"observed_at":"2026-08-08T14:27:51.099046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.831671Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"14425876-008c-4213-b1ba-54ebd0720d22","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.102557Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:3432321b6783c0b8092b43e30a2c727f574712a812b36789e4e9fa32cf4e9b5d","observation_id":"089e71d6-00d3-40e5-99ae-c03ea1fd1b18","resolution":{"observed_at":"2026-08-08T14:27:51.835134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13147","last_updated":"2025-08-08T15:28:01Z","snapshot_observed_at":"2026-08-04T08:26:16.909949Z","submitted_at":"2024-12-17T18:12:47Z","title":"Are Your LLMs Capable of Stable Reasoning?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13147","snapshot_observed_at":"2026-08-08T14:27:51.106013Z","title":"Are your llms capable of stable reasoning? arXiv preprint arXiv:2412.13147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.106013Z"},"links":{"cited_paper":"/paper/2412.13147","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:edb65f133573a75fdfdd031e0c42f6995baf80e89bde0d39cf4f3bb1e527c186","observation_id":"6bf0ca30-56b9-4c38-8e8c-5330ed4184c9","resolution":{"observed_at":"2026-08-08T14:27:51.106013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-08T14:27:51.109531Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.109531Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:6bb052edd2e0e92d5d8792ea47f738ff1a095fa30f447aaa218f7948bcf17a4a","observation_id":"31d1c947-f4ef-4c66-85fe-d0e7361341e5","resolution":{"observed_at":"2026-08-08T14:27:51.109531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.112911Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.112911Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:1ec114d1f34623cc2066d6c62c94fdaa02dee911baf33bdfb45ebf3fa9ca22d9","observation_id":"a2fbfb90-8f35-4cb3-841a-923edbf8e8c1","resolution":{"observed_at":"2026-08-08T14:27:51.112911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.116126Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.116126Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:8afd1fc6d225e65fbb182130247d352f7eefeafd6db3118df022920591641624","observation_id":"92d69a59-5df4-483e-a0c9-aa54a3d0e38a","resolution":{"observed_at":"2026-08-08T14:27:51.116126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.119909Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.119909Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:efaff28e8df26f890c4cd0f967b7337eb214dd7d9ed504412ee34a4936ec4c9e","observation_id":"8c06dc8d-24e4-4e83-830e-513fd2a8a2e0","resolution":{"observed_at":"2026-08-08T14:27:51.119909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.804649Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"e3538b6f-66a8-4d28-8ed9-a79cf6cab2ef","year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.123115Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:ce0ea7748de6352f3880b1f7d528411fbee80b6a648b6ffc9a98b3e980e05282","observation_id":"bb206363-c2c9-43d6-8c8d-729da4200dd5","resolution":{"observed_at":"2026-08-08T14:27:51.808050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-08T14:27:51.126152Z","title":"Metamath: Bootstrap your own mathematical questions for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.126152Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:406c8090d81af0036d018889e8ee12617bd6d9af89c79f9ba5cae39da29789c6","observation_id":"9bfc999a-6fb0-4875-bee1-12abb2e7b0e4","resolution":{"observed_at":"2026-08-08T14:27:51.126152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09003","last_updated":"2024-12-16T06:13:03Z","snapshot_observed_at":"2026-08-09T18:26:40.385608Z","submitted_at":"2024-01-17T06:48:16Z","title":"Augmenting Math Word Problems via Iterative Question Composing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09003","snapshot_observed_at":"2026-08-08T14:27:51.129269Z","title":"Augmenting math word problems via iterative question composing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.129269Z"},"links":{"cited_paper":"/paper/2401.09003","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:42bd8cf439b688dc5b34f5d342b9c32b939fe15a44e87cbd55d0fbed1be32004","observation_id":"cf905594-0d06-4889-9173-68a756270331","resolution":{"observed_at":"2026-08-08T14:27:51.129269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05506","last_updated":"2024-07-17T14:46:17Z","snapshot_observed_at":"2026-07-06T16:29:39.982733Z","submitted_at":"2023-10-09T08:18:58Z","title":"MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05506","snapshot_observed_at":"2026-08-08T14:27:51.132425Z","title":"Query and response augmentation cannot help out-of-domain math reasoning generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.132425Z"},"links":{"cited_paper":"/paper/2310.05506","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:00e059596296787f7443a5b269ef4e640becbda57a0d55025d346885125f0fce","observation_id":"9c17fa23-b188-44c1-88b5-7a3002de14d0","resolution":{"observed_at":"2026-08-08T14:27:51.132425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14201","last_updated":"2023-05-23T16:20:30Z","snapshot_observed_at":"2026-07-06T15:31:36.425535Z","submitted_at":"2023-05-23T16:20:30Z","title":"Goat: Fine-tuned LLaMA Outperforms GPT-4 on Arithmetic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14201","snapshot_observed_at":"2026-08-08T14:27:51.135706Z","title":"Goat: Fine-tuned llama outperforms gpt-4 on arithmetic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.135706Z"},"links":{"cited_paper":"/paper/2305.14201","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:48b3f6d222cf8470a9c1b9820f5b7a55de4d488d49dea9d50eee68955ed4c1c3","observation_id":"edd0dc10-fc9a-4e71-9e4e-f9acf6ecc1da","resolution":{"observed_at":"2026-08-08T14:27:51.135706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-08T14:27:51.138537Z","title":"Mammoth: Building math generalist models through hybrid instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.138537Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:80d4e320cb68cc9e44c642bea2c937436eee523a0ad9b74bdbf90c5d090fa37f","observation_id":"a02c956f-67b4-4333-bf1e-e649ece2d74c","resolution":{"observed_at":"2026-08-08T14:27:51.138537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-08T14:27:51.141898Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.141898Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:942bf066d9c71617444441662d61f1a357bdb925f5022b46fd302a0196e27868","observation_id":"ccde4491-3225-4820-94f6-b3dbd1c7d9ab","resolution":{"observed_at":"2026-08-08T14:27:51.141898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.794782Z","title":"Can large language models reason and plan? Annals of the New York Academy of Sciences, 1534(1):15–18, 2024","venue":null,"work_id":"218bd320-7be0-4a80-afa0-6f2c254ab1af","year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.145468Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:4d84a3e793ededeb5a3c0e33957dff2936f75ae181fd5d3951c6af160648bf83","observation_id":"021f7021-240a-4ea6-b091-9b24fbe92bfc","resolution":{"observed_at":"2026-08-08T14:27:51.798417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-08T14:27:51.148684Z","title":"Wizardmath: Empowering mathematical rea- soning for large language models via reinforced evol-instruct","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.148684Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:9f78caed129be57cf67d8b7662ea06bf10964f91ce8ef86cdf5a5a95cca4b0d5","observation_id":"ab3810a8-8362-4285-8482-3cc08241ea9c","resolution":{"observed_at":"2026-08-08T14:27:51.148684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-08T14:27:51.152051Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.152051Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:e86e712d04d242243da183eba36047ef07ac4af6cf060eea2773b1e74c3884b4","observation_id":"2c04f306-b46e-4265-ba4b-088a53fde1bc","resolution":{"observed_at":"2026-08-08T14:27:51.152051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-08T14:27:51.155707Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.155707Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:52076fa756125cbef2e954eb6d91927d7e69f04824cd63baacf8dc7a1cfb4d0b","observation_id":"36414ed8-e16a-4d3a-9544-5ce4ca0b8136","resolution":{"observed_at":"2026-08-08T14:27:51.155707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.783844Z","title":"You don’t need to re-generate the answer to the question because the standard answer has been given","venue":null,"work_id":"daed89b4-adbf-42d6-9bd3-11989e9b6fb5","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.159064Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:8cea7d69cbc05377ef8111ff74585cd0d1ac5b1439a35b39e61ebbba1e6538ec","observation_id":"db660ffc-25a4-402b-87d3-05a8d08395be","resolution":{"observed_at":"2026-08-08T14:27:51.787477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.774238Z","title":null,"venue":null,"work_id":"fb8ea4ed-d750-4733-aaf6-77102826a83a","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.162379Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:f395c1d639bffd9b0a2f2a0448571743bc5a62093cfce98fb66ae5215397e839","observation_id":"2717bfa1-4154-49af-a700-1ba82d031236","resolution":{"observed_at":"2026-08-08T14:27:51.777395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.764574Z","title":"As long as the answer is the same as the standard answer, it is enough","venue":null,"work_id":"fffed8ce-4001-4e64-bcb4-ba5ba6b574b5","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.165691Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:743608c9d10428a448a6ce6460684215f9efba1c7d4a9c9fecae86d55bf0001e","observation_id":"a0ff2ceb-134e-4708-947a-ab645d6c9128","resolution":{"observed_at":"2026-08-08T14:27:51.767856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.754942Z","title":"And some formulas are expressed in different ways, but they are equivalent and correct","venue":null,"work_id":"852b90eb-75b1-43c0-832c-3f0cc3347c25","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.168809Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:182c8fdf3d3251e6d3fa89bb376bdfea8025a91ec88f63e5d5642d75456a60b2","observation_id":"995844ec-b558-4489-9c11-f784e2b4644a","resolution":{"observed_at":"2026-08-08T14:27:51.758301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.744823Z","title":"A\" or \"B","venue":null,"work_id":"6fa4ac51-9e7c-4ecf-9d1d-ad5ba83e90c8","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.172027Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:1146c7d000284674d12745fd1406e22ca94476272101684e6dfcac7d03e45ee0","observation_id":"d9207753-5c50-4664-a353-bcd4a1e1babf","resolution":{"observed_at":"2026-08-08T14:27:51.748464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.734516Z","title":null,"venue":null,"work_id":"6fffe132-7e02-45c1-91d4-53b9bccf54eb","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.175657Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:47714fd04ad517be35b748057aa96bc8b45ed74739a01f2759331c3b4d7b0017","observation_id":"39f35344-4083-4e5e-8070-4a94cc29d417","resolution":{"observed_at":"2026-08-08T14:27:51.737774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.724773Z","title":null,"venue":null,"work_id":"d83b7425-1a27-4e5e-a6c4-f3b8b1922ac1","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.178803Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:2c26acb133830b3e16bcbe3827316f7e979cd91c7ea7be61cdcd841ed4b06119","observation_id":"644abfb2-54e4-4cb4-8385-84f39da5b153","resolution":{"observed_at":"2026-08-08T14:27:51.728145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.714787Z","title":null,"venue":null,"work_id":"7ab1a896-04d9-4626-b157-d0a1824cc403","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.181847Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:6ef7adcda63aed2c60de998a8f0851ae1f2b9a699acc042502fe761e961f672b","observation_id":"88c346e6-9494-44cb-ba24-e65330c9b28c","resolution":{"observed_at":"2026-08-08T14:27:51.717965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.704736Z","title":null,"venue":null,"work_id":"165c76c1-59eb-4ff4-a8c7-0a89df66279f","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.185024Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:5a057b67a7febb6fc771f110e23c81cee9a1cfd337cad323828c672c6b1e4cab","observation_id":"eb0d0544-e8d6-466c-85c9-256d984231ff","resolution":{"observed_at":"2026-08-08T14:27:51.708176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:27:51.694308Z","title":null,"venue":null,"work_id":"4f14719c-a167-44b1-97f3-78a8a47e7d8e","year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.188077Z"},"links":{"citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:3771e83c368dcc86e6a50d85b89214cea8437ccf09f444f241ed5c80528bbe17","observation_id":"0720b3e7-602e-4467-ac25-8c1517554c68","resolution":{"observed_at":"2026-08-08T14:27:51.698233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 16 inbound Pith citation observations for arXiv:2502.06781."}