{"as_of":"2026-08-17T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e62d77680242541f6248374dac05ea3922d45f4031f155be0cae221e4891fd8","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:46:43.174655Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:57:39.414554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T16:31:09.136154Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21067","snapshot_observed_at":"2026-08-05T14:57:39.414554Z","title":"Why distillation can outperform zero-rl: The role of flexible reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-14T18:22:45.199437Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.414554Z"},"links":{"cited_paper":"/paper/2505.21067","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:3a602b4f64efd5c47d7eb6d47b2968820751afe989d5b8d2fddf923e7122ef08","observation_id":"6bdb1f8e-e9e3-4861-bf3e-f7ee7c8a74e5","resolution":{"observed_at":"2026-08-05T14:57:39.414554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"cited_work":{"arxiv_id":"2505.21067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21067","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.21067 , year=","venue":null,"work_id":"91437f94-c294-4e58-b6ce-83b2eed3aade","year":null},"citing_paper":{"arxiv_id":"2605.02290","last_updated":"2026-05-04T07:26:41Z","snapshot_observed_at":"2026-08-10T20:20:22.759976Z","submitted_at":"2026-05-04T07:26:41Z","title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-09T16:29:05.186607Z"},"links":{"cited_paper":"/paper/2505.21067","citing_paper":"/paper/2605.02290"},"observation_digest":"sha256:1c3498d6aad3d6dc2d41567c67a2c50c4173d9f9272475f2e71269c2dafe9a03","observation_id":"4b363ec6-1ca6-4012-bce3-8534fa828932","resolution":{"observed_at":"2026-05-11T16:31:09.142870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21067/citation-record","integrity":"/paper/2505.21067/integrity","json":"/paper/2505.21067/citation-record.json","paper":"/paper/2505.21067"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:46:39.894509Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:39.894509Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:51f276c896603640b98065e7d8a1f29145c48cffa1c868a9fd7559c3afe1692a","observation_id":"5e8cb2c5-5492-4022-b8e7-9b9a882ce3d1","resolution":{"observed_at":"2026-08-07T13:46:39.894509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:46:40.046652Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.046652Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:52cdc4cdc8e6fb7578d74bdf4d6383afe353d450fc8a794ee08f73445c19c790","observation_id":"981c39d1-d827-41f5-a62b-4912f5041cc0","resolution":{"observed_at":"2026-08-07T13:46:40.046652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T13:46:40.168204Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.168204Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:4a0cb98e1305c9b7cb4bfe11e13d1313ae849b04ae93023d69db51f5770b4431","observation_id":"ebdb321a-74b0-43d6-b6f8-4b1d477de23b","resolution":{"observed_at":"2026-08-07T13:46:40.168204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:45.763194Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"c51a014e-1e96-4112-ab3d-9e4b52f78c8c","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.172117Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:e4fb7b7812719ef3a8fb6c2db273bafe94dad25fdea1b6aeab2b3ce5c5bb80c7","observation_id":"77e1b567-0a35-4885-835a-dbfa5b57368f","resolution":{"observed_at":"2026-08-07T13:46:45.826113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:45.569374Z","title":"Gemini 2.5 pro: Our most advanced reasoning model, March 2025","venue":null,"work_id":"38a97776-da5a-46e2-bde5-5fa1119ff5e6","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.194428Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:4d9039e77612d41be13a0120c99dfc95696256582f2a471dc73946d40c528670","observation_id":"51452794-1b2c-4f67-81d7-0ce7b073abdc","resolution":{"observed_at":"2026-08-07T13:46:45.637961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T13:46:40.242659Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.242659Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:1d585c4a111adefbf29ff155b057ecf45ea1763c44901493e0c741cdb746743b","observation_id":"d286a298-6483-441a-a45e-2b5f44b6188c","resolution":{"observed_at":"2026-08-07T13:46:40.242659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T13:46:40.291885Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.291885Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:656978d93ca82575f9cd62978885f86fb2f8c77922fdd5803957efaec083be6a","observation_id":"7d034978-e838-4bee-a108-f5280c13d47a","resolution":{"observed_at":"2026-08-07T13:46:40.291885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-16T12:57:41.261147Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T13:46:40.358276Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.358276Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:a52b73b0f786e36a5b4f95f2c1b7d3ea20172ac0fdd163036c99a8a0058c74a0","observation_id":"12b3dd73-f9b7-4c0c-abc1-d33bcdacbf4e","resolution":{"observed_at":"2026-08-07T13:46:40.358276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:46:40.382950Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.382950Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:4a9e4b0b8b1c7da6c19fe5d9ed8a500c8dccf8d8e281c744ad9533f124b3e2cf","observation_id":"b5f5ff59-2f3b-4638-b652-9df06b60a614","resolution":{"observed_at":"2026-08-07T13:46:40.382950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T13:46:40.408551Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.408551Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:18211eb06d980fc457d8df54fc11e6157184179867e907c08b3e543e360ef0ba","observation_id":"ad2aecdf-48b8-479c-bf29-d366e3f30ebf","resolution":{"observed_at":"2026-08-07T13:46:40.408551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T13:46:40.444115Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.444115Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:22f55945a45ba9651b44637da5a2f41e7a51933971d8020669e67fcefc2e0847","observation_id":"fdb7b38c-e581-4cf4-b9aa-c9cb8cccb713","resolution":{"observed_at":"2026-08-07T13:46:40.444115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T13:46:40.447364Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.447364Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:58c1617a51dba3f9ccb893c6e7d942b6b362cbc84e7d8300adccf480fac553ad","observation_id":"3209e50a-0aff-4c99-8a20-2a8d9c5610d6","resolution":{"observed_at":"2026-08-07T13:46:40.447364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T13:46:40.524734Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.524734Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:f9f2666c01185167b142fb663dcf7a259098b5e2addeb482ef529704ea8cf585","observation_id":"1212dfaf-7f7c-43df-b814-d0ab3ba330f3","resolution":{"observed_at":"2026-08-07T13:46:40.524734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T13:46:40.632602Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.632602Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:20cd34a34b613b679b6a6cf878f62325daa794e1d87b3ade6845e3d4148d7133","observation_id":"de59cf55-b8b1-41c2-8bc2-ec41781e6e41","resolution":{"observed_at":"2026-08-07T13:46:40.632602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T13:46:40.704947Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.704947Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:e498c8cc4e9570225d9391de194b0955bdf566fd89775f8b513c16a71ade1c01","observation_id":"23a507f2-0234-4681-ab37-c7177a4073be","resolution":{"observed_at":"2026-08-07T13:46:40.704947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:46:40.781652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.781652Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:679272b8a89d85edbfe50b75ec5c7949bf6505c3e7a679b81d09aa3f40f8bc3f","observation_id":"a26f125e-fcc6-4fb3-88fa-2c3a7cc3f445","resolution":{"observed_at":"2026-08-07T13:46:40.781652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T13:46:40.944799Z","title":"Step- dpo: Step-wise preference optimization for long-chain reasoning of llms.arXiv preprint arXiv:2406.18629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.944799Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:b61c1892bbcc5b1603b0742b96efd5fb4e732ab6cdfbd9ade4820e792f22b951","observation_id":"1122bdd9-2470-4da0-a66b-0cc656f55190","resolution":{"observed_at":"2026-08-07T13:46:40.944799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:41.098216Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.098216Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:0f50e701b25f7176b2cd162764e2074ca2c210719ceebe55dcb86076ae700992","observation_id":"a4230d17-5916-46f5-b094-5da04ed6c08e","resolution":{"observed_at":"2026-08-07T13:46:41.098216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T13:46:41.230911Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.230911Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:597f0306108b5256d04cf013712e74c12a91d6be7f7a3b4cbb19603cd4ce2a75","observation_id":"c5d293f0-a5fa-4dab-bb85-22bde31f9a9e","resolution":{"observed_at":"2026-08-07T13:46:41.230911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:46:41.410507Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.410507Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:9dcbea394ca2df53ff40e574d3642adef380737db5412368684b0489d2a39394","observation_id":"6bda4652-793a-442a-8e04-743df8910793","resolution":{"observed_at":"2026-08-07T13:46:41.410507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:46:41.480449Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.480449Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:6d9777fb6fca4f378fad6fa63f18a84e09740147577a3e0cec6dceb8d9366dea","observation_id":"d859aa5a-3e98-4474-8094-0e91b0b685cf","resolution":{"observed_at":"2026-08-07T13:46:41.480449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02956","last_updated":"2025-04-03T18:22:20Z","snapshot_observed_at":"2026-08-16T12:44:09.815711Z","submitted_at":"2025-04-03T18:22:20Z","title":"Understanding Aha Moments: from External Observations to Internal Mechanisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02956","snapshot_observed_at":"2026-08-07T13:46:41.603694Z","title":"Understanding aha moments: from external observations to internal mechanisms.arXiv preprint arXiv:2504.02956, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.603694Z"},"links":{"cited_paper":"/paper/2504.02956","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:0a9d3fef87a147a54df59debd8fc3c5b993869a2b1be1f884cb8b739ddc02764","observation_id":"b9ec0550-b0f2-4b91-80a2-7ae41c75cbd8","resolution":{"observed_at":"2026-08-07T13:46:41.603694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:45.378761Z","title":"Bespoke-stratos: The unreasonable effectiveness of reasoning distilla- tion","venue":null,"work_id":"604b3b7a-0a12-411b-b783-1c709b62340b","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.721544Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:08c038ef6d4867b0a4c307eee08aaa02e990a302ef85f63139c02499ec027809","observation_id":"6ed44878-47bc-437b-9d66-0f0e4318022d","resolution":{"observed_at":"2026-08-07T13:46:45.479474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-15T17:15:16.352032Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-07T13:46:41.856018Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems?arXiv preprint arXiv:2501.11284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.856018Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:cc058d4d7be9f5cf864ad985ca55f327f9fddcf5814f52e7a0698b08804b49f3","observation_id":"7fcb8a4d-1292-4391-ba39-3ac59747cd87","resolution":{"observed_at":"2026-08-07T13:46:41.856018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T13:46:41.916225Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.916225Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:b14f8d68ee2b0659bacda8b41cc448988fd8374c1e22639afd2bc17779174231","observation_id":"22eae47c-d1d7-4c11-bd8d-07f167d12658","resolution":{"observed_at":"2026-08-07T13:46:41.916225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:45.120329Z","title":"American invitational mathematics examination 2024 part 1, 2024","venue":null,"work_id":"cfdedeb6-9282-472c-815d-d7bb213d547f","year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:41.980985Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:ef8e0328aa8af0c1f2457470935089387ad233ea44316ac484054ead0308918e","observation_id":"5dd5662e-4475-4b69-85fc-b0b28ab22321","resolution":{"observed_at":"2026-08-07T13:46:45.262072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:44.981576Z","title":"American invitational mathematics examination 2024 part 2, 2024","venue":null,"work_id":"9dff6c1b-f4df-4d3b-a90c-fa50fc8654f5","year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.054101Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:0381e4e876b517a92d325609e2163ebdb7733682d9a18fe1e8378c5b80a28879","observation_id":"3adf5f29-287e-4e93-ad9d-aec408064789","resolution":{"observed_at":"2026-08-07T13:46:45.065868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:44.779720Z","title":"American invitational mathematics examination 2025 part 1, 2025","venue":null,"work_id":"a2f1267d-ea00-4950-b744-103a34f24334","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.125387Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:7a63c1c437de93000a9dcd395282b9e5fa32c945423f33d6f5432f0ebdd51596","observation_id":"e73a6865-d7e6-4612-b193-3e7645b2e4b9","resolution":{"observed_at":"2026-08-07T13:46:44.871083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:44.588407Z","title":"American invitational mathematics examination 2025 part 2, 2025","venue":null,"work_id":"a2728bc1-ec83-4cc0-ab7a-b3120e854280","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.196712Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:d5f5693c147d3f3f394293d0c2fc02a685d5bba67213309704215ce36b89bd88","observation_id":"72bfa3ea-b9e4-4c0f-b1e4-685df00245de","resolution":{"observed_at":"2026-08-07T13:46:44.692831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:44.421710Z","title":"Hmmt february 2025 dataset","venue":null,"work_id":"3cd26e1c-293a-42b3-ad31-2b1464e5dbb0","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.256987Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:6fad1147e0784e6b60f959842d00f6bb538fd32a802c8695da6820859eee0251","observation_id":"6a3c5022-58da-488e-86f6-cfc041ab58cf","resolution":{"observed_at":"2026-08-07T13:46:44.484512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:42.314347Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.314347Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:5ea97495d6dc573466ec4a73e520edbc6142890bb2683f37fe8bf5dcc160fad8","observation_id":"16ad271f-b2a9-4b39-848b-b808ffa0dd92","resolution":{"observed_at":"2026-08-07T13:46:42.314347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:46:42.404452Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.404452Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:9175730f5b97cb1ffca5ff3bf8755f079f18ed494b0c0d61df560fe1bb39cde6","observation_id":"f1788c9f-7d98-4d88-87f2-ffa10fc76e3d","resolution":{"observed_at":"2026-08-07T13:46:42.404452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:42.476673Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to reproducibility.arXiv preprint arXiv:2504.07086, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.476673Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:3464a191b87ee2c9fc122a77f59ed80858b3f0acbed8e4ac593581d1b6d75ba2","observation_id":"4e9584e2-2f46-4080-9463-46ac2f3d115a","resolution":{"observed_at":"2026-08-07T13:46:42.476673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T13:46:42.546131Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.546131Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:5cfeb74c0e24e9a23573179d29943b0bf8bdb91ba18dac7745628d9505505fe5","observation_id":"d106ebfb-aaed-4694-ba55-7bf613dea488","resolution":{"observed_at":"2026-08-07T13:46:42.546131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-07T13:46:42.641108Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.641108Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:791298e9ca48002eefa1eb06000b27783898ba4d34c02d9e8ae8ac5932d076c1","observation_id":"b756eddc-63a1-41ea-b5be-19d0af8f9ecc","resolution":{"observed_at":"2026-08-07T13:46:42.641108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:44.241577Z","title":"Assessing metacognitive awareness.Contem- porary educational psychology, 19(4):460–475, 1994","venue":null,"work_id":"fa0c5976-aae8-42a0-a799-1846a9111cd7","year":1994},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.715586Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:359585c957eb45be7fbd1289cc9331502bb711a3e6445db9decb0ff66706d855","observation_id":"6c4cce4b-9625-43ad-ad17-40c096faeca5","resolution":{"observed_at":"2026-08-07T13:46:44.322504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:46:42.815990Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.815990Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:21bccf6caa1f71768347de2d703ccf816c2b705bf70b09c231928af3870cbb06","observation_id":"0b604add-089e-44a5-9f0c-b6f06b4f223c","resolution":{"observed_at":"2026-08-07T13:46:42.815990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:42.891459Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.891459Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:a23442405a3a6c9e69deca4d281589ce2f4443be431f70adbfc8aba9f6444bb4","observation_id":"88201bb7-28b0-4882-9951-9e52223f5302","resolution":{"observed_at":"2026-08-07T13:46:42.891459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T13:46:42.990726Z","title":"Qwen2.5-math-cot","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:42.990726Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:9d493c557af09b043edc2c018487035f8d815fecd53bdbfd19b9944d59434e3a","observation_id":"2fdd44cc-4231-4b58-8921-fd5afaba7506","resolution":{"observed_at":"2026-08-07T13:46:42.990726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:44.044476Z","title":"Qwen-boxed","venue":null,"work_id":"6248a755-0e22-44de-a5e3-75c6a19d9bd2","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:43.065912Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:8796a930927b7d1f1789d6be6bc18371dcee88567abe01af45b059b3713835a3","observation_id":"1b8199f5-b5b2-4d5e-be25-5f928a0ce9b4","resolution":{"observed_at":"2026-08-07T13:46:44.149742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:43.820031Z","title":"let’s try another angle","venue":null,"work_id":"845c1251-0215-4802-808d-abe130d4b9ae","year":null},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:43.140924Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:6e879bf5a6657b25d5f90f7d600ecc2357869417c3cb22d7cee373f1979d7825","observation_id":"251e146d-c47d-4751-86ff-82cdd30e28ce","resolution":{"observed_at":"2026-08-07T13:46:43.925564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:46:43.636569Z","title":"wait, maybe my approach is wrong here","venue":null,"work_id":"e3905a93-1e36-444d-a4b7-9a71af52c074","year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:43.174655Z"},"links":{"citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:2f82ab46079751a9083a773926684738fc457508d35158acb2c250d779cd72be","observation_id":"a3056307-a6f4-423f-80cf-ba182fd2e6bc","resolution":{"observed_at":"2026-08-07T13:46:43.710362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T13:47:23.049807Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2505.21067."}