{"as_of":"2026-08-10T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:705c43157244768b432958b83253e146c4f2ed30f5876f9b70dec37f4e7d2266","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:26:08.536798Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:18:39.658589Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T22:43:37.868176Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:6b1786c171174b937cd82fadc654071389fe9fbb1d53907e0c835290c84c24fb","observation_id":"cc5cb283-56ab-47d4-a8ee-94f90b6acb05","resolution":{"observed_at":"2026-05-16T22:43:37.870506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2603.11321","last_updated":"2026-04-04T03:49:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-11T21:33:41Z","title":"Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T12:44:50.752937Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2603.11321"},"observation_digest":"sha256:74893c4e83766997d39628865534ad3a6c879bf9b364030916fb8f14eb83043b","observation_id":"73d7339c-e9ef-4e58-b417-a13640e62122","resolution":{"observed_at":"2026-05-15T12:45:37.299666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2604.06079","last_updated":"2026-04-07T16:58:14Z","snapshot_observed_at":"2026-08-08T07:28:08.490235Z","submitted_at":"2026-04-07T16:58:14Z","title":"Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T19:45:40.915428Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2604.06079"},"observation_digest":"sha256:46e18354a0fd7beff8063eab6c972a0897e026334a81cba435b69df24de5afce","observation_id":"d0d6a44c-6a40-42d8-bd33-517004870c9c","resolution":{"observed_at":"2026-05-10T22:30:53.376328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical two-stage recipe for mathematical llms: Maximizing accuracy with sft and efficiency with reinforcement learning","venue":null,"work_id":"bbe05dc2-ac41-4b56-8a28-d7c9794ab5b1","year":2025},"citing_paper":{"arxiv_id":"2604.08926","last_updated":"2026-04-10T03:42:16Z","snapshot_observed_at":"2026-08-08T09:07:59.114719Z","submitted_at":"2026-04-10T03:42:16Z","title":"Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:26.829527Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2604.08926"},"observation_digest":"sha256:e2041b314a9bb7b4114702e8a9c3d4b1750a964c038b6e375439ca9770388d7d","observation_id":"4757bf6b-42e1-436c-812b-69a03b3cd5cf","resolution":{"observed_at":"2026-05-11T08:06:00.003903Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-08-02T10:18:39.658589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22642","last_updated":"2026-06-24T00:12:03Z","snapshot_observed_at":"2026-08-08T11:02:32.765828Z","submitted_at":"2026-06-24T00:12:03Z","title":"CRAFT: Learn the Schema, Execute the Plan","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T10:18:39.658589Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2607.22642"},"observation_digest":"sha256:2612cca32f357f3a17ef64d72c9568e3a10c093f0137cd53b161efebee871280","observation_id":"b7e02888-5225-4b44-9d33-6f18a8d8d872","resolution":{"observed_at":"2026-08-02T10:18:39.658589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08267","snapshot_observed_at":"2026-07-31T21:13:06.724007Z","title":"Chen Zhang, Luis Fernando D’Haro, Yiming Chen, Malu Zhang, and Haizhou Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24199","last_updated":"2026-07-27T09:24:41Z","snapshot_observed_at":"2026-08-07T18:43:26.314228Z","submitted_at":"2026-07-27T09:24:41Z","title":"Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T21:13:06.724007Z"},"links":{"cited_paper":"/paper/2507.08267","citing_paper":"/paper/2607.24199"},"observation_digest":"sha256:7c3f362a68e63bc26040d10222dce1cbdc3ba46b170861a15b093723826ca5b9","observation_id":"94b467e5-494d-45ae-ab3b-100edb5b663d","resolution":{"observed_at":"2026-07-31T21:13:06.724007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.08267/citation-record","integrity":"/paper/2507.08267/integrity","json":"/paper/2507.08267/citation-record.json","paper":"/paper/2507.08267"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.461183Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.461183Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:60451236b4363eecdc68a5eadc96fe23c4c542dc8688c56d00067603a6aa11cc","observation_id":"b57bf2b3-6c37-4caf-9e90-3603c8f86b2f","resolution":{"observed_at":"2026-08-06T18:26:08.461183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T18:26:08.464611Z","title":"and Welleck, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.464611Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:9c76cfbccb12de865013b8083178c6245b434c87ed1f5b495bd7cbe9c8435117","observation_id":"64f6567c-e674-4803-a3b2-9a077cd0b661","resolution":{"observed_at":"2026-08-06T18:26:08.464611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T18:26:08.467197Z","title":"V., R \\'e , C., and Mirhoseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.467197Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:b134908e16515e0055a975ed544a7593a887b8d3d3e496c38cca0bd5afab3911","observation_id":"92ed019e-744e-403f-88e5-6f7c2f51ed3d","resolution":{"observed_at":"2026-08-06T18:26:08.467197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.946447Z","title":"Alphamath almost zero: Process supervision without process","venue":null,"work_id":"2079d7e9-ecff-43f2-9927-d6f3a3d79345","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.470895Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:5caa0e747391890fa85438ed0d2d38356fdc11fac269377b1257e30cdc4c4ba5","observation_id":"3fe5eb46-0af6-40a4-9cdd-03814bc37907","resolution":{"observed_at":"2026-08-06T18:26:08.949427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.473351Z","title":"and Ngo, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.473351Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:d7e8c299e13be1d32e5a7d16f95e59d734fb813abb16e78b20ef84724ebb7fa4","observation_id":"7e909581-2699-444c-a2d5-827300282a19","resolution":{"observed_at":"2026-08-06T18:26:08.473351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:26:08.475643Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.475643Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:643e7ead4258b4849e45a2e05a8ff342824c51a65d71aff54aaeca04f51ed87b","observation_id":"37aca5f0-c980-4c84-ae41-f2358fc22c83","resolution":{"observed_at":"2026-08-06T18:26:08.475643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.477985Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.477985Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:0a230540b1e2519a9997dd7c6e5e54a0398736f4c2d80adf647d49eb22a5b865","observation_id":"580f2210-02d4-4d7c-aa92-f4e60816498c","resolution":{"observed_at":"2026-08-06T18:26:08.477985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.936075Z","title":"C., Buzzard, K., Gowers, T., Liu, P","venue":null,"work_id":"78008d55-7b16-47e1-add8-35e47eaac3ca","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.480618Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:6b1a45be1b5fd1f4eda638d753d1c65ba0fb3d5dd294434bdb8295ff6916945a","observation_id":"f6258d02-8f85-4857-8d2d-d5583d8f9fdc","resolution":{"observed_at":"2026-08-06T18:26:08.938412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.928733Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"862dbaab-593a-419b-b42d-e81ba19b23ae","year":2021},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.483094Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:d9f061292143d125c46e0fbe700ce103973f542a353ad9a280bed3ee431c48d1","observation_id":"f6dfa5ca-d1dd-4f0a-88ba-63076368c673","resolution":{"observed_at":"2026-08-06T18:26:08.931008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T18:26:08.485151Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.485151Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:65f28a4d8f27c530fd043864421b5a39078d17f9f96c562b99f61241afc28daa","observation_id":"71208300-83d6-435a-8ee8-eb585246e9b9","resolution":{"observed_at":"2026-08-06T18:26:08.485151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.921969Z","title":"C3ot: Generating shorter chain-of-thought without compromising effectiveness","venue":null,"work_id":"4a53ca59-f617-4956-9574-3e8bbd04d312","year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.488176Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:29ac53c87bac434af8adc88c1f0dd59ebcf1c5b20fa10ccab1c492acade80311","observation_id":"3bf86600-963a-49d0-b315-4e4c9a5dd9a4","resolution":{"observed_at":"2026-08-06T18:26:08.924347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T18:26:08.490527Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.490527Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:cdcb8261ae4923b38cfb82adb1d0de1e7765aae752409b180928c2f87aedf328","observation_id":"34d686bd-584d-427a-a481-721473558fc3","resolution":{"observed_at":"2026-08-06T18:26:08.490527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.914952Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"467a12d3-2268-400f-903f-9c516d245347","year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.492780Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:31004c73103f95e8e27c554a0d79c572cd321c1b4158871da570ed5150cea034","observation_id":"97a5c783-791f-435b-8a72-10a9db1142a4","resolution":{"observed_at":"2026-08-06T18:26:08.917123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.494732Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.494732Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:cefc42ddc641fd0f6161637ead57de52682ce7728b9c47e53a08fc7a615f4ee7","observation_id":"86cb55e2-32e5-41a4-917c-00cdee1a533a","resolution":{"observed_at":"2026-08-06T18:26:08.494732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.903018Z","title":"Can language models learn to skip steps? In The Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":"fc206b3b-0236-40d1-a361-29a49b4d2997","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.496800Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:ac0a5acc1bf87141b67c4b5ba3dd9650ebb90b51e6055f7571cd645c707e0b25","observation_id":"d67c5727-2112-4cbd-8b15-c01819965be2","resolution":{"observed_at":"2026-08-06T18:26:08.906089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-08T03:22:47.699927Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-06T18:26:08.499132Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.499132Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:bdfcd5e184dc17244676d8cdd7b82790e5c914455a30067210e5298dfc932efa","observation_id":"b6a561d6-ea7c-40c9-9b64-6c5474e58b1c","resolution":{"observed_at":"2026-08-06T18:26:08.499132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.501675Z","title":"Wider or deeper? scaling llm inference-time compute with adaptive branching tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.501675Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:682ecf699845f5f7399bc0ad0179560d49a2b3991f180d2929a27ab0e9c2f1a0","observation_id":"b34e44a7-7b90-4f77-b857-fadfa7d5e00a","resolution":{"observed_at":"2026-08-06T18:26:08.501675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T18:26:08.503965Z","title":"L., Fei-Fei, L., Hajishirzi, H., Zettlemoyer, L., Liang, P., Candès, E., and Hashimoto, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.503965Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:7bdb28771ce7c544d7cb7f61bed16c5893c274f6145bc509e720fd65aa733810","observation_id":"540f1a2e-80f3-4915-ab92-4d4b1f879a47","resolution":{"observed_at":"2026-08-06T18:26:08.503965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-08T01:06:04.764010Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-06T18:26:08.506610Z","title":"H., Yang, Y., Kim, Y., and Yun, S.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.506610Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:ed0cfddae02fefd31ec082e82e27cf471ca5fcaedc3a68e0bac56aa055a7cb9b","observation_id":"2a50dcea-77aa-48c6-b002-3b3d8b4a68ee","resolution":{"observed_at":"2026-08-06T18:26:08.506610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:26:08.509681Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.509681Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:ef68fa61e7f4d6df6c955f676315432393131a8555a59384c0e448f1578bd754","observation_id":"58b1e904-03b7-4c56-81ca-614ffd5da247","resolution":{"observed_at":"2026-08-06T18:26:08.509681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-09T14:06:29.234036Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-06T18:26:08.512634Z","title":"Competitive programming with large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.512634Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:e214ef40920bcf4e76dcf3d7e2034c7f0bf1ac3eabdf0a3690de7a54c3233d7d","observation_id":"8bd696b0-af35-491a-bd05-22225f5cf6a0","resolution":{"observed_at":"2026-08-06T18:26:08.512634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.895749Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":"b72ae8c2-1ca3-4f7e-9ebf-4ee4e50362a6","year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.515249Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:58faa6e29fd502f21ca1971fb039eb77a965b2ac283207daa7794185c5e6b68d","observation_id":"02302a27-eca4-4170-b3c1-f439d6e8558b","resolution":{"observed_at":"2026-08-06T18:26:08.898157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:26:08.517455Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.517455Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:e386289bc0432c6902b9e3ebb787735ff9de92636a50eb0249358c004a293fe7","observation_id":"8615f2d8-2c23-4121-9b1b-6851900bd419","resolution":{"observed_at":"2026-08-06T18:26:08.517455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T18:26:08.520090Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.520090Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:62bd346c21009ccf589aa6e4cc83b8eb39887a9e18e66fbb16bf8c61225abc73","observation_id":"c9e81936-ede2-4c91-8adf-4e591b2ceaf4","resolution":{"observed_at":"2026-08-06T18:26:08.520090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.522615Z","title":"H., Le, Q","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.522615Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:20a5ec2c0d1e3bd224acaa3544c232dc9606bcf105740dec2e34bbd65a488d44","observation_id":"aa33f8c4-dc5e-4f4f-b329-bcc927e8dd22","resolution":{"observed_at":"2026-08-06T18:26:08.522615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-08T01:11:14.602172Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-06T18:26:08.525387Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.525387Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:b57f1e43524ff9533c8ba3aae05218a27501c1a51ac1c3d8610d7d6211b8a2a9","observation_id":"6c52c4c3-7204-4084-8ba8-a61935fa4f62","resolution":{"observed_at":"2026-08-06T18:26:08.525387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.883323Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for LLM problem-solving","venue":null,"work_id":"bbb0956b-7225-442d-9a05-9bc2a8ba167c","year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.527957Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:89ccf85dcb7b1a17d6810ae9b17fbc0bbb9426c4716a44512dcd8966f218c72e","observation_id":"2df7098c-9852-4f97-8a62-9c8852132e61","resolution":{"observed_at":"2026-08-06T18:26:08.885946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.530115Z","title":"T., Wang, W., and Li, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.530115Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:817ef9cd6e8e9f79eef6d825462972be051d1d8d86f1e6275649b0f7f67d955c","observation_id":"21d4e395-d743-4d01-aa42-52e48ab6cfea","resolution":{"observed_at":"2026-08-06T18:26:08.530115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-06T18:26:08.532302Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.532302Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:4be915cd6b13cd8cdc3e9454806413373428bfe218d6ff50485d576fb2bbf529","observation_id":"8d0d3622-a270-4a90-b1b8-f81966e32d0a","resolution":{"observed_at":"2026-08-06T18:26:08.532302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:26:08.874330Z","title":"Demystifying long chain-of-thought reasoning in LLM s","venue":null,"work_id":"e70beb8b-e110-476a-a6c4-c0a1f59b9de4","year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.534689Z"},"links":{"citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:d3c26d538ff80a83ff10ade7b4d23ec31b555fafe67025eede5c763dc3540c01","observation_id":"cb22ee4b-3048-4dc8-8a0d-33c50d00818a","resolution":{"observed_at":"2026-08-06T18:26:08.878484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T18:26:08.536798Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:26:08.536798Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.08267"},"observation_digest":"sha256:465f5be64ad38c33f01e358b564ee82c95cdf91afd15a6e7727cbd24b00f6aeb","observation_id":"432f3e6a-5dd0-4835-afcf-14f230158f4b","resolution":{"observed_at":"2026-08-06T18:26:08.536798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08267","last_updated":"2025-07-11T02:26:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:06:58.092959Z","submitted_at":"2025-07-11T02:26:01Z","title":"A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 6 inbound Pith citation observations for arXiv:2507.08267."}