{"as_of":"2026-08-20T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47f0734d9514c1b2389844faa6676b7b0a107e8aa14e07fcfd0815a5dea489b8","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:52:05.518110Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:32:13.384509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:59:51.967723Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-15T15:20:51.338738Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-21T23:39:39.018498Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2507.01679"},"observation_digest":"sha256:2a0db7905f5e615db49cbf592f6c5e9fd7b4c4ec60a48efc19e250705aaffeea","observation_id":"18ce7cce-fbc7-45bb-96c2-2bb845d70217","resolution":{"observed_at":"2026-05-21T23:40:46.412977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-06T14:51:25.423521Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.423521Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:90e20d0c1994d1d5aea841687d7cd72b29d3e234d93f9c02ff64c667e50f30a7","observation_id":"d8941b72-95c4-4586-a154-9027845a5560","resolution":{"observed_at":"2026-08-06T14:51:25.423521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-06T05:48:28.554889Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01317","last_updated":"2025-08-06T06:44:57Z","snapshot_observed_at":"2026-08-13T20:04:42.445845Z","submitted_at":"2025-08-02T11:09:06Z","title":"LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T05:48:28.554889Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2508.01317"},"observation_digest":"sha256:8d81e5949eb5920f33c1ff6263ba56023e8af7be7945ecccdfb080798596d1de","observation_id":"adbfa44c-b68c-4764-a063-580da13d60af","resolution":{"observed_at":"2026-08-06T05:48:28.554889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-06T05:43:18.003368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01326","last_updated":"2025-08-02T11:37:16Z","snapshot_observed_at":"2026-08-13T13:39:01.162259Z","submitted_at":"2025-08-02T11:37:16Z","title":"Large-Scale Diverse Synthesis for Mid-Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:18.003368Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2508.01326"},"observation_digest":"sha256:b9a2f63497ae70be679b2359256ed1688f82883ca59d611ab4b7b22202a6c37f","observation_id":"b8317bc3-54de-4590-a75c-37df5c60a5d1","resolution":{"observed_at":"2026-08-06T05:43:18.003368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-05T20:17:12.589663Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.589663Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:10d154c5e5bd0c45dbd4e8fe16d5d402130ed434abc83ff54a034dd87206e751","observation_id":"ef6e6e4c-790c-4b24-8c58-4716de72ec9d","resolution":{"observed_at":"2026-08-05T20:17:12.589663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-04T21:32:59.788638Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07953","last_updated":"2025-09-09T17:41:29Z","snapshot_observed_at":"2026-08-14T11:53:09.061661Z","submitted_at":"2025-09-09T17:41:29Z","title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T21:32:59.788638Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2509.07953"},"observation_digest":"sha256:5b77dd98be3f4fa8057dea71fa49ed111e273537357632342ba39f8e50a9acff","observation_id":"c659ab70-9778-4f58-b8fa-30abd22cbe4e","resolution":{"observed_at":"2026-08-04T21:32:59.788638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-04T16:07:43.404800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:43.404800Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6807182feee619539f32f23c5effdc348b9152a7ca9655a6e61b0d5e71ebbe52","observation_id":"13915e3a-a539-4303-9c73-15d01e11b28b","resolution":{"observed_at":"2026-08-04T16:07:43.404800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-04T08:55:58.773353Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-13T23:07:53.470526Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.773353Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:6f7f96bc3721dcfd77a2c6ce3646ba4e1530d1cb511391c24c582efbf3c1f9c0","observation_id":"67b20b37-35a5-48b2-8b64-50cd07d52306","resolution":{"observed_at":"2026-08-04T08:55:58.773353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-03T23:27:37.675267Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05933","last_updated":"2026-06-24T14:20:52Z","snapshot_observed_at":"2026-08-07T19:34:44.238702Z","submitted_at":"2025-11-08T08:56:29Z","title":"Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T23:27:37.675267Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2511.05933"},"observation_digest":"sha256:063348dd73a41165a4655990556a14c4668790b0a7e48cd0ab27c38361ad4e1c","observation_id":"60c30425-b1ca-4821-bba3-baf13a75143b","resolution":{"observed_at":"2026-08-03T23:27:37.675267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2511.16624","last_updated":"2025-11-20T18:31:46Z","snapshot_observed_at":"2026-08-13T19:30:37.668913Z","submitted_at":"2025-11-20T18:31:46Z","title":"SAM 3D: 3Dfy Anything in Images","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T11:47:11.554134Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2511.16624"},"observation_digest":"sha256:945fb65ec48572d30b5ee19809992ceef152ebe2a71e7f8010f5aadcf99d9b39","observation_id":"939ad9d8-6458-47d3-a519-4c336360443d","resolution":{"observed_at":"2026-05-11T11:47:15.036120Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-03T19:38:23.124972Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-13T20:04:46.001790Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T19:38:23.124972Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:0096b15671fcafd238e6c461309390c74340e2c0ab370d1bba3cdb2bd0b01007","observation_id":"dc0cabda-655d-41ec-87ab-9ac6b21e9e92","resolution":{"observed_at":"2026-08-03T19:38:23.124972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-04T06:47:16.891598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-13T20:04:46.001790Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.891598Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:fba775ff0ba38449fa016d8bfbb227bcfd1bf80053a1740ce8f1d6141b4d7379","observation_id":"5d203758-1e76-44d3-9140-7655cad53b77","resolution":{"observed_at":"2026-08-04T06:47:16.891598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-03T05:14:21.405084Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-12T09:46:52.523380Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.405084Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:2b1801b13365068d72cf2c457ca51e2c2ac35d93348fa994d2aad12929c1ad61","observation_id":"5877dcad-ab33-452d-90da-745304b5d0a3","resolution":{"observed_at":"2026-08-03T05:14:21.405084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2604.06377","last_updated":"2026-05-05T18:37:43Z","snapshot_observed_at":"2026-08-11T13:29:25.505319Z","submitted_at":"2026-04-07T19:02:10Z","title":"The Master Key Hypothesis: Unlocking Cross-Model Capability Transfer via Linear Subspace Alignment","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:44.401045Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2604.06377"},"observation_digest":"sha256:2a41a3b276e77a11f9be93aa546b03f4423bf458044eaba4718a1ea5683ae794","observation_id":"2346ce8e-b95e-460a-a771-8ede395b587e","resolution":{"observed_at":"2026-05-11T00:15:55.899355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-08-11T21:11:54.456177Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:4a0bb1ee3d701b2af605e704e31db8d0278802fbcb228b9c2193e902e48e69f7","observation_id":"d4d9d98e-bd5b-4311-80bc-c0906307defc","resolution":{"observed_at":"2026-05-11T11:41:04.004819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-14T08:41:23.060090Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:789ce5a7ca6ccd721283d5a95d67c3375e55c069fefd19efa0780cb10eadedb5","observation_id":"9d4b2c58-29f4-4393-b7cd-4a463c65bba8","resolution":{"observed_at":"2026-05-10T06:06:19.539437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2605.13369","last_updated":"2026-05-14T02:40:02Z","snapshot_observed_at":"2026-08-15T02:09:04.244467Z","submitted_at":"2026-05-13T11:27:40Z","title":"Query-Conditioned Test-Time Self-Training for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T20:04:51.248797Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2605.13369"},"observation_digest":"sha256:b718967364c2e1ac4861c2c2342124b0b1f9a50a70b31dcc1ff643b5727df062","observation_id":"bdbd9c5c-a6a3-438e-91ca-75d45231740d","resolution":{"observed_at":"2026-05-14T20:07:54.089983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2605.13369","last_updated":"2026-05-14T02:40:02Z","snapshot_observed_at":"2026-08-15T02:09:04.244467Z","submitted_at":"2026-05-13T11:27:40Z","title":"Query-Conditioned Test-Time Self-Training for Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T05:53:42.235498Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2605.13369"},"observation_digest":"sha256:b44d4ee1d56933fe3c39d6b0c39c6bc77047f09ccb3b9b6ecc189909a736a7e0","observation_id":"d703ccae-ce48-4c5e-8210-0a8781f004f1","resolution":{"observed_at":"2026-05-15T05:55:04.846371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2605.18261","last_updated":"2026-05-18T11:59:31Z","snapshot_observed_at":"2026-08-15T22:55:25.139821Z","submitted_at":"2026-05-18T11:59:31Z","title":"Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T10:21:00.882064Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2605.18261"},"observation_digest":"sha256:fe3738014dc2afbaf8a8698408c1a567826ca3cc28c53e29f33c3b08b38314dc","observation_id":"0fc009b1-53fb-4da9-ad04-80a7ab58f589","resolution":{"observed_at":"2026-05-20T10:23:12.087277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2605.20066","last_updated":"2026-05-19T16:20:57Z","snapshot_observed_at":"2026-08-13T04:21:51.850230Z","submitted_at":"2026-05-19T16:20:57Z","title":"Text-to-SPARQL Generation with Reinforcement Learning: A GRPO-based Approach on DBLP","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:31:11.191388Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2605.20066"},"observation_digest":"sha256:f84162c6c251864bee56024ba3d5f61bacfeb1457eb51c77b48e69358218f477","observation_id":"6b5a8e6b-a893-4e3c-8a92-8a48f313ac67","resolution":{"observed_at":"2026-05-20T05:33:03.987076Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2605.27564","last_updated":"2026-05-26T18:36:42Z","snapshot_observed_at":"2026-08-13T14:26:44.338100Z","submitted_at":"2026-05-26T18:36:42Z","title":"The Future of Facts: Tracing the Factual Generation-Verification Gap","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T18:31:04.169632Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2605.27564"},"observation_digest":"sha256:2ef6e7be5b103c47dab563106b876d7525c7fc006ff4c40d5f7903c008f68a7f","observation_id":"3b478f30-6f23-4581-a2b3-d0ad9651221d","resolution":{"observed_at":"2026-06-29T18:33:50.419029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.03608","last_updated":"2026-06-02T13:11:09Z","snapshot_observed_at":"2026-08-07T00:11:41.078023Z","submitted_at":"2026-06-02T13:11:09Z","title":"Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T10:53:00.223228Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.03608"},"observation_digest":"sha256:fe8b87591034220261fefe4ac5f2d5e9274a31fa2ce0e5b0975f75bbd0d13db1","observation_id":"e758cdd0-5a2c-4c81-b43c-3917ec7ce817","resolution":{"observed_at":"2026-07-02T02:26:27.236550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.04889","last_updated":"2026-06-03T13:51:27Z","snapshot_observed_at":"2026-08-17T17:14:59.103519Z","submitted_at":"2026-06-03T13:51:27Z","title":"GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T05:59:00.005336Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.04889"},"observation_digest":"sha256:29819d0a36fc1cbce05d6d7ae615617afa2de8d0267ad62cb5703452ac4e8be5","observation_id":"a3e1adbb-b97d-4e67-86f4-3e734304c20b","resolution":{"observed_at":"2026-07-02T08:36:47.603371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:6a04ee82c26c90e1cdf07308a09ff4259a0fd9d31056af28fd72c880b0d164fc","observation_id":"669a75df-30e2-4d7a-831d-0b8a5667faa5","resolution":{"observed_at":"2026-07-02T12:06:56.418404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:cb11cd0836fd2e9bf9df1ff1eb905027abf01619287c99d27d31f76af390ce15","observation_id":"32374512-3c5e-4da4-bf6d-26d1d08dc426","resolution":{"observed_at":"2026-07-02T12:16:56.982648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.19005","last_updated":"2026-06-17T12:32:46Z","snapshot_observed_at":"2026-08-16T01:52:46.158671Z","submitted_at":"2026-06-17T12:32:46Z","title":"Sumi: Open Uniform Diffusion Language Model from Scratch","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T20:34:43.697141Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.19005"},"observation_digest":"sha256:f5f8e6d5975edb6d929df6241b355d061db5b9c88346c92747002b66f9c158d7","observation_id":"576f1bcd-e701-4314-a36a-0e07764004bf","resolution":{"observed_at":"2026-07-04T01:09:19.753058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.27369","last_updated":"2026-06-25T17:59:36Z","snapshot_observed_at":"2026-08-14T02:54:31.610293Z","submitted_at":"2026-06-25T17:59:36Z","title":"Reinforcement Learning without Ground-Truth Solutions can Improve LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T04:47:47.691913Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.27369"},"observation_digest":"sha256:9766e6a08e4c4a1a385fa23575a548d77653e1b9bb2cb601a12f2c7ccd07175f","observation_id":"9dbf31ad-e306-4508-9fc4-435d05ab4ea3","resolution":{"observed_at":"2026-07-04T13:59:51.969197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.27733","last_updated":"2026-08-11T07:28:23Z","snapshot_observed_at":"2026-08-20T03:07:28.747657Z","submitted_at":"2026-06-26T05:29:08Z","title":"BashCoder-R1: Towards Robust and Explainable Bash Code Generation with Robustness-Aware Group Relative Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T04:16:04.477464Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.27733"},"observation_digest":"sha256:587c20cfa631e579b0a980c84ef5876b328fc02b7239d2e47ca31c840e890dc5","observation_id":"55efe14e-984f-4d5d-a268-308f1c1c4626","resolution":{"observed_at":"2026-07-01T17:05:50.853682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:26c293ab3efcc9764a3f10341f2c2ecd5a3867ffc455207029d24928db711ed5","observation_id":"ba993dc2-d7c1-4805-bf0a-76acd9fd48c9","resolution":{"observed_at":"2026-07-01T07:05:29.233867Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.32029","last_updated":"2026-06-30T17:54:50Z","snapshot_observed_at":"2026-08-12T17:11:03.245479Z","submitted_at":"2026-06-30T17:54:50Z","title":"When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T05:25:56.914399Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.32029"},"observation_digest":"sha256:eb077f40ac8e3e1e40f6bb84df0cd9bb116d2e1f1f915d0bf1b00c4b13cc29df","observation_id":"d438acb0-8fb1-4806-bda1-c06e768a7a4e","resolution":{"observed_at":"2026-07-01T10:35:41.342530Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-31T07:01:43.604779Z","title":"arXiv preprint arXiv:2506.20512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-08T00:53:22.078848Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.604779Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:343fae079fb9359d34af0e7493c1bae83efd05ea7f199baf5c64ac1dbf4419aa","observation_id":"a4ace8ce-f77b-4adc-84fb-f20c7b127fc1","resolution":{"observed_at":"2026-07-31T07:01:43.604779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-14T04:32:13.384509Z","title":"OctoThinker: Mid-training incentivizes reinforce- ment learning scaling.arXiv preprint arXiv:2506.20512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13545","last_updated":"2026-08-13T17:56:12Z","snapshot_observed_at":"2026-08-17T23:53:20.073266Z","submitted_at":"2026-08-13T17:56:12Z","title":"LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:13.384509Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2608.13545"},"observation_digest":"sha256:b821b9296adbd08a4fe48b670cfdd0afe073a513a7de2d34c32c3aaa4dd2c060","observation_id":"da7b42ed-f429-4851-b35a-c8196afec172","resolution":{"observed_at":"2026-08-14T04:32:13.384509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20512/citation-record","integrity":"/paper/2506.20512/integrity","json":"/paper/2506.20512/citation-record.json","paper":"/paper/2506.20512"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-20T14:44:18.211453Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-06T22:52:05.294425Z","title":"Behl, S \\' e bastien Bubeck, Ronen Eldan, Suriya Gunasekar, Michael Harrison, Russell J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.294425Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:442658ce05c90bbe28f290c23de67535fb7a51c704211dd85bb3e0541ca7e065","observation_id":"929091d6-a92c-44a4-9033-f3f2ca02a490","resolution":{"observed_at":"2026-08-06T22:52:05.294425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T22:52:05.299864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.299864Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:fddde49ae5592d7e023de3c29647da30ad94cd201ee2b2e935da3ae5fa668fda","observation_id":"caadb374-c96d-43b2-b30f-7b6d072ec2ad","resolution":{"observed_at":"2026-08-06T22:52:05.299864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-14T05:03:05.661970Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-06T22:52:05.304965Z","title":"Smollm2: When smol goes big - data-centric training of a small language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.304965Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:e8afef74539aaeb34e63f7f2865635d2e02ce76bd540a6b33378d78e3db81832","observation_id":"58ed5096-4ca2-4ee0-a4b6-47b71c506583","resolution":{"observed_at":"2026-08-06T22:52:05.304965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.356288Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":"376fca9e-145b-4918-ab2c-d538a69aff99","year":2019},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.309417Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:2d8dbe45c9939273ebe73f2a9a8d5c100f8bf5892697c980008b1d1213c14002","observation_id":"2888274e-5224-47db-bc55-5cd049667693","resolution":{"observed_at":"2026-08-06T22:52:06.360449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.314312Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.314312Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:70386327217c15ff33717989a337970194bcc48563f851366d934c0eac7c749f","observation_id":"a51e9972-3454-49ef-bab2-f8a1ceb5ff57","resolution":{"observed_at":"2026-08-06T22:52:05.314312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19146","last_updated":"2025-06-03T12:02:03Z","snapshot_observed_at":"2026-08-17T14:28:16.308225Z","submitted_at":"2024-11-28T13:45:42Z","title":"Puzzle: Distillation-Based NAS for Inference-Optimized LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19146","snapshot_observed_at":"2026-08-06T22:52:05.318809Z","title":"Puzzle: Distillation-based NAS for inference-optimized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.318809Z"},"links":{"cited_paper":"/paper/2411.19146","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:9f93e62ac6c51f8994551b301179ba1a9154ed6acdf514da02ad1ca5e109a7eb","observation_id":"c9d7d25c-fadd-425f-8568-f3ad62498718","resolution":{"observed_at":"2026-08-06T22:52:05.318809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.323803Z","title":"Llama-nemotron: Efficient reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.323803Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:1aa0aeda4f9c503c764173d70676f26e3dcffaef716bf28a1fab2fc1c89d3709","observation_id":"d657da24-bb83-4cbf-a411-07bce32b6ceb","resolution":{"observed_at":"2026-08-06T22:52:05.323803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T22:52:05.327980Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.327980Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:4b8d3425d7bbccf1de3ed428b2b93502b5ecb6ec04e6b19044c343bced24f899","observation_id":"c67a416f-8d7f-4307-8a13-004bc6d008b9","resolution":{"observed_at":"2026-08-06T22:52:05.327980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T22:52:05.332462Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.332462Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:fb1ce7bb2094496678ce96d745157ee8a618c85b9851ec9293aeba27094f308f","observation_id":"ff991753-d2ba-4dc4-8cd8-4f15f47cc95d","resolution":{"observed_at":"2026-08-06T22:52:05.332462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.336845Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.336845Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:6b10d7fa6438fbefa6cfd90bf8c04e890a9ebfa205afd8fcd48da4c773875021","observation_id":"e1a23e6c-7bb1-43ee-92c8-2c30c0b7df0d","resolution":{"observed_at":"2026-08-06T22:52:05.336845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-06T22:52:05.341465Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.341465Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:ce77fdb90ac0575775964eaab9f58255bab6499384fd8dccf8937aa687869026","observation_id":"61ecd802-5387-4e14-b5a6-6073b91ed178","resolution":{"observed_at":"2026-08-06T22:52:05.341465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12982","last_updated":"2025-02-18T16:04:57Z","snapshot_observed_at":"2026-08-16T12:57:16.479583Z","submitted_at":"2025-02-18T16:04:57Z","title":"Sailor2: Sailing in South-East Asia with Inclusive Multilingual LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12982","snapshot_observed_at":"2026-08-06T22:52:05.345605Z","title":"Tran, Mike Zhang, Shiqi Chen, Tianyu Pang, Chao Du, Xinyi Wan, Wei Lu, and Min Lin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.345605Z"},"links":{"cited_paper":"/paper/2502.12982","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:eb237b3f2941cf47d5983768f581c3213391d7589de9b2b8b7e230bfe8f8d6f0","observation_id":"3421b259-5927-4b0a-a9a3-2ddc0dec2d6b","resolution":{"observed_at":"2026-08-06T22:52:05.345605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:52:05.349613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.349613Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:bcc148e48302e6b517b234e67d5563a4d86ca4d0f6e3c40a495e0d2ae93ab5eb","observation_id":"911403fa-58dd-47a8-b391-83cee0c03df9","resolution":{"observed_at":"2026-08-06T22:52:05.349613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-06T22:52:05.354143Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.354143Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:d3b00a9edfff3ee048b0d6896650e23b3b26490dcbf0f114538c650e99f30f21","observation_id":"412ca939-8e09-423b-8593-cb07098072d2","resolution":{"observed_at":"2026-08-06T22:52:05.354143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:52:05.358503Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.358503Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:90e96bdd286ec69079fa465f3c11b4739f275e215c6baa9a95e562e176dbb8b5","observation_id":"9b624733-24ad-41fa-a483-0ad778281b9f","resolution":{"observed_at":"2026-08-06T22:52:05.358503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.333314Z","title":"Infi MM -webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning","venue":null,"work_id":"282bbcb3-e139-4f2f-92f9-18653afb7491","year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.362497Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:ebfef73e51ecad6993c48a2f830ba8b51a89c0749cc9876546021255add46f41","observation_id":"40e64994-d9c5-4039-a752-06cfd274aa5a","resolution":{"observed_at":"2026-08-06T22:52:06.337771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.366697Z","title":"Olympiadbench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.366697Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:d1b8153bfa26f7336f42a8a1f50c4909223181d102e28938916b4767237ff567","observation_id":"fa3d8727-6f3e-4250-ade8-c5f6b732c88f","resolution":{"observed_at":"2026-08-06T22:52:05.366697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.370603Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.370603Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:5906caa21ecf6d26c5a7b7215415293957731d9d0dca15216c2a74e3ca7a5c46","observation_id":"71197d56-ceca-403a-ae74-519e4a708844","resolution":{"observed_at":"2026-08-06T22:52:05.370603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T22:52:05.374846Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.374846Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:a3a80f597d114f74daebe7ec1b485147353bef69423542262a7450ce55175023","observation_id":"517401c8-bb18-401d-a19c-32522e9b8007","resolution":{"observed_at":"2026-08-06T22:52:05.374846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T22:52:05.378916Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.378916Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:6bbcce98767ad0bacdc1284fa9cd07b91128da87edb7db89e69e0656abe593a7","observation_id":"f383e86c-955c-4243-92b1-b1a511ae4f9c","resolution":{"observed_at":"2026-08-06T22:52:05.378916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T22:52:05.383515Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.383515Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:d11c3038232aa5289222f457bda4420afde2fe953e0b928f175af89993be5e9f","observation_id":"0773918f-4cf9-4f32-b3c3-20a092f0ad9e","resolution":{"observed_at":"2026-08-06T22:52:05.383515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.387635Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.387635Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:63a1d4bb953d7f5713d3789ae9498ce804a034980ce9354e9bbdbb02545679ee","observation_id":"1157c3ec-3dfb-4399-a34a-854b1e7e3c5f","resolution":{"observed_at":"2026-08-06T22:52:05.387635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.291733Z","title":"Mawps: A math word problem repository","venue":null,"work_id":"182d023a-535a-49a6-8ebb-4de865ec1170","year":2016},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.391813Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:1013dcba675b290717b1b2ecf84b0d2ef42c080c57c9d3dfb38afa5b2fec3c9f","observation_id":"292af8cf-d9ac-4c0d-81f2-200803b4fa1d","resolution":{"observed_at":"2026-08-06T22:52:06.296015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T22:52:05.395822Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.395822Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:d13f3b260d3e3d68878e0ead8c17b2ce7f89bc96e1a83afa515a24a5f780f1ec","observation_id":"9563caa2-1a9e-426e-8c31-6e698813945f","resolution":{"observed_at":"2026-08-06T22:52:05.395822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T22:52:05.400522Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.400522Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:bb3db78dbb7fc9aa55a94f1e56b43b99b07a1c68feacd5f3c331d4d76232ee00","observation_id":"9b8feced-0230-4c83-9391-6ec317cb6918","resolution":{"observed_at":"2026-08-06T22:52:05.400522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.278303Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman - Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur - Ari, and Vedant Misra","venue":null,"work_id":"193eaf6f-b53c-456d-b73f-40a4d5787876","year":2022},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.404810Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:30bc961fccb879068a16af0e80a2e0ed5e202bf65806c0e1c9583b39b09dffd0","observation_id":"daa28f16-e706-4fe5-a113-4efd81675bce","resolution":{"observed_at":"2026-08-06T22:52:06.282462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.408671Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.408671Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:865912e8cba2168daef475d4ce026473d20570f1d1f461d0fe0078fe21d25648","observation_id":"89bb13e7-368a-4004-9562-02310017278c","resolution":{"observed_at":"2026-08-06T22:52:05.408671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T22:52:05.412514Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.412514Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:c442337292a3ae083a8a864067945f2fa6d3ccb836b600b054cb9460a3fb234d","observation_id":"65cb26dd-5b41-4fec-8575-8a00428e08bf","resolution":{"observed_at":"2026-08-06T22:52:05.412514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T22:52:05.416710Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.416710Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:9c455afebd1c9ec3d2473d3863400d313f675bddd5b8e460d6b92b243ed44154","observation_id":"1251579e-ea1f-48d4-92bd-5b7c03c374fc","resolution":{"observed_at":"2026-08-06T22:52:05.416710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T22:52:05.420871Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.420871Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:1b609b599765b7ad6296a20cba1053c3faf1a36bf12a963aadefd23252922c40","observation_id":"da330cee-41dc-4db6-b959-64dfd496c82b","resolution":{"observed_at":"2026-08-06T22:52:05.420871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.255542Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":"734476af-809b-4677-8d64-550377d9f555","year":2023},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.425103Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:0bed64d27caff328065eef7528a95dd57a5812b97bad22bd08c719a332bf8df0","observation_id":"2fbc964f-05cd-437c-91da-87bcd0c8392a","resolution":{"observed_at":"2026-08-06T22:52:06.259901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.241642Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"9b183d63-410d-4220-adcb-b550dd901b5a","year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.429064Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:68564ddef465ad21b093a1c4738253f77662ab99d7a75791e1eb21bffe40aee4","observation_id":"dfc3b450-3ab7-4840-85aa-39c4a4ad266d","resolution":{"observed_at":"2026-08-06T22:52:06.246156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:52:05.433019Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.433019Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:ceb15415e1d073ef71e6746c05888f6202a09e68e53b00ac33d8c0eff59aa236","observation_id":"8928c801-905e-420a-91e4-ecaed0a0b48f","resolution":{"observed_at":"2026-08-06T22:52:05.433019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.228617Z","title":"A diverse corpus for evaluating and developing english math word problem solvers","venue":null,"work_id":"19a847b3-5aa3-40c9-9388-9a887d17d19f","year":2020},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.437072Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:00f519edfc6e2477a5fe49cd02591e501250610d410061c1e17c60a1c66460da","observation_id":"c5f940e9-4831-4e9f-a37e-64b29f917ca5","resolution":{"observed_at":"2026-08-06T22:52:06.232659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-06T22:52:05.441159Z","title":"Murray, Crystal Nam, Valentina Pyatkin, Aman Rangapur, Michael Schmitz, Sam Skjonsberg, David Wadden, Chris Wilhelm, Michael Wilson, Luke S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.441159Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:42b11898e1c051298c3670cd0a3a99294f26222931d23fd957db6bf53e5a44be","observation_id":"71955f78-bbb2-49d3-973e-4d8085020009","resolution":{"observed_at":"2026-08-06T22:52:05.441159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.215499Z","title":"Introducing openai o3 and o4-mini | openai, April 2025","venue":null,"work_id":"1c2b6cb9-b7a8-4cbd-8be0-c8075173d8d7","year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.445297Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:53c3a948a3310810eb7647a216066a561083c80f4b8439acc68ef189763b7500","observation_id":"0aaa0c9a-4954-4ec5-9107-6ce4b8f7816f","resolution":{"observed_at":"2026-08-06T22:52:06.219472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T22:52:05.449157Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.449157Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:cc129e1362dcb8aaf9449bcdf4800129889c132cb00f41dae311468d48d742ba","observation_id":"cc9157ba-2e02-422b-b451-c9724d4b5243","resolution":{"observed_at":"2026-08-06T22:52:05.449157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.453673Z","title":"Openwebmath: An open dataset of high-quality mathematical web text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.453673Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:e3c67eea91272ed0f437dd101718248a4f8ae2cdcc5cbe9c8846d0edbd253296","observation_id":"ac5fe4e2-e053-4b46-88d0-fea47c453f0a","resolution":{"observed_at":"2026-08-06T22:52:05.453673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.193519Z","title":null,"venue":null,"work_id":"5b5c42b9-f8c6-4e69-b6cb-53f557123b8e","year":2021},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.457662Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:84121adcdf7499af6cbf871d5b4e672877898ebbc0a2a13e18c9438f894521d3","observation_id":"e15ece67-2dbf-4414-b18a-b61522ce84a9","resolution":{"observed_at":"2026-08-06T22:52:06.197571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T22:52:05.462042Z","title":"Zettlemoyer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.462042Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:d10f42911272a89649a4f3948d060b0245a8ca969ee63dc6759467a2ff88fb9e","observation_id":"4c0b8fcf-9b99-4446-8d7e-3af410306ce9","resolution":{"observed_at":"2026-08-06T22:52:05.462042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:52:05.466700Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.466700Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:f7b40ba89f8fc3396df9588e6b22076e262ed51ec634dd555922d39ec5899756","observation_id":"a920ac3e-ef93-482e-a0cc-1a2b5cf27fc6","resolution":{"observed_at":"2026-08-06T22:52:05.466700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T22:52:05.471516Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.471516Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:3c08e740fc0c4fcbdd15e942a8c3c5a851f97b921b8eeea54dbf8f26eed67222","observation_id":"9e4dd77a-3d4d-4073-bdba-4025517f6ad1","resolution":{"observed_at":"2026-08-06T22:52:05.471516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01253","last_updated":"2025-01-22T15:09:58Z","snapshot_observed_at":"2026-08-16T16:50:21.438663Z","submitted_at":"2024-12-02T08:22:56Z","title":"Yi-Lightning Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01253","snapshot_observed_at":"2026-08-06T22:52:05.475987Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.475987Z"},"links":{"cited_paper":"/paper/2412.01253","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:5745cda53bc52ad1b2173fbf02ede580a47dea11d4248af881573d9fe2fc6f90","observation_id":"2a5d9039-bf41-4e53-b2ad-6382f8516dc2","resolution":{"observed_at":"2026-08-06T22:52:05.475987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-06T22:52:05.480386Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.480386Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:84ce84143e9b035074e28218b3775f8f39a9cc73be4374bdabe2ddbd7b7a8c53","observation_id":"db169a52-7fcd-4069-9202-58c8caba5ea3","resolution":{"observed_at":"2026-08-06T22:52:05.480386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:06.177827Z","title":"Mathpile: A billion-token-scale pretraining corpus for math","venue":null,"work_id":"83f7df1d-7466-4abe-9bf3-8468cda385b4","year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.484580Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:a4c4b3e14ec72e122fb6583345caa98aad0f39c84a6bf71ccf1e92132a460681","observation_id":"51ea2f7c-d7d4-45f9-b240-7a45841c4876","resolution":{"observed_at":"2026-08-06T22:52:06.184013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.488692Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.488692Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:fcb8cc677622ef3ff95573e12f73ce9ff046b7f5bc1f773832ffa0f4c344670d","observation_id":"13e66756-f81a-4faf-992b-6f9c79c1b74c","resolution":{"observed_at":"2026-08-06T22:52:05.488692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-06T22:52:05.492777Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.492777Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:56ef3cc6cae02b67a0f424d455c94d6998d0a857664172894977b5787212ad02","observation_id":"f4dd5087-a61e-42fc-8bda-303ebd4f342a","resolution":{"observed_at":"2026-08-06T22:52:05.492777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T22:52:05.497044Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.497044Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:a67ce219e97acca5ec8cc21fd5eb8ceb8f1649958deb375330c34de95cea05c3","observation_id":"988b1b55-d734-4e77-b00a-5a9d17fdda05","resolution":{"observed_at":"2026-08-06T22:52:05.497044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:52:05.501310Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.501310Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:eb637ada50ce6c47c646d18a63a3636feeac57dfedff5e662a019cc07821623a","observation_id":"53ecc5cd-73f7-43d3-a95f-f1d81640c141","resolution":{"observed_at":"2026-08-06T22:52:05.501310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T22:52:05.505403Z","title":"DAPO: an open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.505403Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:d63e7ce73911423d3636cd7b055219e9d709ca286c1920f0e1ef511d42077d3b","observation_id":"c65920a3-dddc-4552-83ad-b0475a4caafa","resolution":{"observed_at":"2026-08-06T22:52:05.505403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T22:52:05.509858Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.509858Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:dca4dd9c98167fce60f513978fc599a39b83ecef5ca04775a025c16b6a153e9c","observation_id":"62f44857-132a-43e2-a473-329d03f21ba2","resolution":{"observed_at":"2026-08-06T22:52:05.509858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:52:05.514023Z","title":"Wildchat: 1m chat GPT interaction logs in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.514023Z"},"links":{"citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:0c950ffb836e26ce40778e28ee21603e44ebb6455a0161c136c16116863a0623","observation_id":"b2d41fb7-5123-41f5-a502-a652bd9d0f90","resolution":{"observed_at":"2026-08-06T22:52:05.514023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02807","last_updated":"2025-04-03T17:52:07Z","snapshot_observed_at":"2026-08-16T12:44:10.686741Z","submitted_at":"2025-04-03T17:52:07Z","title":"MegaMath: Pushing the Limits of Open Math Corpora","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02807","snapshot_observed_at":"2026-08-06T22:52:05.518110Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.518110Z"},"links":{"cited_paper":"/paper/2504.02807","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:8a2080dba5b76a9d36a4d758088a6e86e5b6fb5412ad154e1795c45e5b3c3e56","observation_id":"5362a314-eefa-40b4-be62-a8ef38279548","resolution":{"observed_at":"2026-08-06T22:52:05.518110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 32 inbound Pith citation observations for arXiv:2506.20512."}