{"as_of":"2026-08-10T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01ef7461561d39ebfe356f246ec06333b807dd9171538b6bc58471da2b49a137","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:19:43.839213Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06296/citation-record","integrity":"/paper/2608.06296/integrity","json":"/paper/2608.06296/citation-record.json","paper":"/paper/2608.06296"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-07T10:19:41.326448Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.326448Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:7762e7ee78aaedf9e5106f30232a9478029a92612521410abed89d01d118b57c","observation_id":"f9d279ec-09f0-4ddb-9790-a4860180521e","resolution":{"observed_at":"2026-08-07T10:19:41.326448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-07T10:19:41.411447Z","title":"Etash Guha, Ryan Marten, Sedrick Keh, Negin Raoof, Georgios Smyrnis, Hritik Bansal, Marianna Nezhurina, Jean Mercat, Trung Vu, Zayne Sprague, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.411447Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:9d4d7298add6fe3bd88604b4ae511b00d90de187137dee0aaa8bcdc9964e896f","observation_id":"1b7637fa-51c4-4807-a2f1-43ef153e9df6","resolution":{"observed_at":"2026-08-07T10:19:41.411447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-09T02:57:31.005115Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-07T10:19:41.444364Z","title":"URL https://arxiv.org/abs/2506.04178","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.444364Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:ca7000f20bf8592b883a62547f8341825e7a627e3ff839cad3d7ba2df425976f","observation_id":"f9cb2373-0e40-4d27-8f14-1197802d626e","resolution":{"observed_at":"2026-08-07T10:19:41.444364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-07T10:19:41.572940Z","title":"Large language models can self-improve.arXiv preprint arXiv:2210.11610,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.572940Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:4857028e7c87b5154a32ad33b8d17f28f18df70eeee16252d3744b8fea2c859e","observation_id":"df86c3a3-12bb-4391-b060-2bf05ce0c6dc","resolution":{"observed_at":"2026-08-07T10:19:41.572940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06597","snapshot_observed_at":"2026-08-07T10:19:41.728357Z","title":"Aditya Prakash, Josiah Hester, Jindong Wang, and Srijan Kumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.728357Z"},"links":{"cited_paper":"/paper/2605.06597","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:900bb35a94bedde023ccdaa5272ea20b0561291561baff9023e8f8f219fd9977","observation_id":"a710c963-c998-47cc-9513-7d4135445f1a","resolution":{"observed_at":"2026-08-07T10:19:41.728357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13255","snapshot_observed_at":"2026-08-07T10:19:41.784586Z","title":"Respecting self-uncertainty in on-policy self-distillation for efficient LLM reasoning.arXiv preprint arXiv:2605.13255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.784586Z"},"links":{"cited_paper":"/paper/2605.13255","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:10de2956d00e1199a2fabf281c760ab52c946ab5525e289eda1b3d62ce80b2f0","observation_id":"ae2517a6-bafe-45a7-9921-e2a36b8ff6e1","resolution":{"observed_at":"2026-08-07T10:19:41.784586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-07T22:39:15.110117Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-07T10:19:41.827630Z","title":"press/v267/ko25a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.827630Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:f19b546efae726930e80c89934ff9f84bca50fabaeec4d8abe47598353e67442","observation_id":"f2c04ddc-ed22-4a6b-8056-4cdb81fed65e","resolution":{"observed_at":"2026-08-07T10:19:41.827630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.13929","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:44.873558Z","title":"Self-evolving visual questioner.arXiv preprint arXiv:2606.13929,","venue":null,"work_id":"8e31beac-21e2-40b7-bf11-ad318ed892b0","year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.853544Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:08b96a54f8775a336555647a8cf1e9d0fbbfd7725cb1603c6c3176d4b988caf0","observation_id":"d1caa6be-f65c-45c2-a1a6-d0a3c4949e81","resolution":{"observed_at":"2026-08-07T10:19:44.930747Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:41.914010Z","title":"Spiral: Self-play on zero-sum games incentivizes reasoning via multi-agent multi-turn reinforcement learning.arXiv preprint arXiv:2506.24119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.914010Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:8601c130019a606477de339bb332e10c85ddc750758a7a8b2e1700b5128bed80","observation_id":"cce98735-534e-4d7b-bec6-723f40a9ff5b","resolution":{"observed_at":"2026-08-07T10:19:41.914010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11559","last_updated":"2026-06-10T01:35:34Z","snapshot_observed_at":"2026-08-09T19:16:39.411102Z","submitted_at":"2026-06-10T01:35:34Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","version":1},"cited_work":{"arxiv_id":"2606.11559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11559","snapshot_observed_at":"2026-08-07T10:19:44.532912Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","venue":"cs.AI","work_id":"62263c6a-1666-4fc1-acec-6cdbb7901f76","year":2026},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.961817Z"},"links":{"cited_paper":"/paper/2606.11559","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:84be534e1669684f7d2964584a84a877adf46f58b716ae978f19f6068eae5cc9","observation_id":"dbbaa0a1-f975-4e45-b0a9-8fad67c2f673","resolution":{"observed_at":"2026-08-07T10:19:44.623767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:42.025433Z","title":"URL https://thinkingmachines.ai/ blog/on-policy-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.025433Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:45181be5d5d2d34321cc18c889e5e5fa2c5bffdcf89ff7dd856c46ae1e2da481","observation_id":"5409db2d-a287-478d-9367-4c9e5523aa91","resolution":{"observed_at":"2026-08-07T10:19:42.025433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-10T06:34:18.837515Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-07T10:19:42.100814Z","title":"Emiliano Penaloza, Dheeraj Vattikonda, Nicolas Gontier, Alexandre Lacoste, Laurent Charlin, and Massimo Caccia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.100814Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:02f138d812714bb936873985d2385fb980a5c4caae4ff0f2d6ab267610dc69e6","observation_id":"5ddeec39-3bf7-488d-a025-b484ce551768","resolution":{"observed_at":"2026-08-07T10:19:42.100814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-09T07:55:48.130608Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-07T10:19:42.170600Z","title":"Maximizing confidence alone improves reasoning.arXiv preprint arXiv:2505.22660,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.170600Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:05c40ebc5525c0b6486558bc7641d91df87490fa6dca742667a15a43ec45d2f4","observation_id":"fdd5552c-0f46-4046-b580-ea0c1db55611","resolution":{"observed_at":"2026-08-07T10:19:42.170600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04109","last_updated":"2025-07-06T18:16:47Z","snapshot_observed_at":"2026-07-06T19:46:15.364468Z","submitted_at":"2024-11-06T18:36:22Z","title":"Self-Consistency Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04109","snapshot_observed_at":"2026-08-07T10:19:42.234006Z","title":"Self-consistency preference optimization.arXiv preprint arXiv:2411.04109,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.234006Z"},"links":{"cited_paper":"/paper/2411.04109","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:08a55ed3ad79191b2eeb17b4d020148da94675ef3a39ba696525530b3cc8f920","observation_id":"4caa0439-287f-4296-bd16-6aa4e452b899","resolution":{"observed_at":"2026-08-07T10:19:42.234006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-07-15T14:32:24.776402Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-08-07T10:19:42.294503Z","title":"CRISP: Compressed reasoning via iterative self-policy distillation.arXiv preprint arXiv:2603.05433, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.294503Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:3a7d0841d38138c1dd2b55876be299b36393983f192488113b8ab5e659e97cc8","observation_id":"7b608f62-0f24-4183-bf92-ecf1227a2398","resolution":{"observed_at":"2026-08-07T10:19:42.294503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:19:42.384243Z","title":"Deepseek- math: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.384243Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:9bd8a72aad324f2b48a7fa133bbd7afe179383acfa6ed5525b97c931535967bf","observation_id":"21f116ed-e599-4564-8d34-7d621f60020a","resolution":{"observed_at":"2026-08-07T10:19:42.384243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-10T06:11:48.831491Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-07T10:19:42.449663Z","title":"Self-distillation enables continual learning.arXiv preprint arXiv:2601.19897, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.449663Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:70ab5befe5ab8957f0990a833b275b025a8e2b49bd8bae2a11e990ed0478b719","observation_id":"a9f0db98-ed67-46b7-8b0d-98bb297156c5","resolution":{"observed_at":"2026-08-07T10:19:42.449663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-07T10:19:42.513853Z","title":"Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, and Kam-Fai Wong","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.513853Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:5ecbf4ab63a5e3f695985b3063952b53408aa7a4e8e7dbd1bf40fae19d646cf1","observation_id":"d2ee794e-11d1-41ac-a219-3fda760934a1","resolution":{"observed_at":"2026-08-07T10:19:42.513853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.13399","last_updated":"2026-07-15T02:52:37Z","snapshot_observed_at":"2026-08-06T12:04:36.871552Z","submitted_at":"2026-07-15T02:52:37Z","title":"Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations","version":1},"cited_work":{"arxiv_id":"2607.13399","doi":"10.48550/arxiv.2607.13399","metadata_source":"pith","pith_arxiv_id":"2607.13399","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations","venue":"cs.CL","work_id":"be01684d-9d09-4bf9-a762-62c5f159091f","year":2026},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.587810Z"},"links":{"cited_paper":"/paper/2607.13399","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:7786b3fff4fd7734b4ade37a1ebe7bdb91b267395ba0cf0d880d0640131d6598","observation_id":"2154647d-37e0-44a8-9cd8-93e4ab1e3cd2","resolution":{"observed_at":"2026-08-07T10:19:44.047486Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01754","last_updated":"2025-03-19T18:35:44Z","snapshot_observed_at":"2026-08-07T17:32:58.635348Z","submitted_at":"2025-03-03T17:24:42Z","title":"SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01754","snapshot_observed_at":"2026-08-07T10:19:42.700966Z","title":"ISBN 979-8-89176-288-6","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.700966Z"},"links":{"cited_paper":"/paper/2503.01754","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:2ef1101c0c307e3e082ece70ec8c2019340f151e651374b72b9c8b20e69dedfc","observation_id":"84d0f8aa-9ec0-4549-9c80-977a7ede8044","resolution":{"observed_at":"2026-08-07T10:19:42.700966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-07T10:19:42.801108Z","title":"Lightning OPD: Efficient post-training for large reasoning models with offline on-policy distillation.arXiv preprint arXiv:2604.13010,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.801108Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:3befa69027674a66b449b0e658babfcd62f47d789bd80414c49cb41639116799","observation_id":"97b0ba77-58c6-42f0-9eea-bfb789c67920","resolution":{"observed_at":"2026-08-07T10:19:42.801108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-07T10:19:42.927212Z","title":"URLhttps://arxiv.org/abs/2604.13010","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:42.927212Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:5afee40770dc88f0643a9ec348b605f759a0e5b6771f366212cc2db88caf4b19","observation_id":"e5f4537e-e154-4c97-a652-cdf41624b582","resolution":{"observed_at":"2026-08-07T10:19:42.927212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T10:19:43.007032Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.007032Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:97aa0702489f4991cdf3519eabb0be4d74e2cf9a03012135c29833385343c347","observation_id":"2c84e049-02db-4bd7-b671-bc8815b22c4f","resolution":{"observed_at":"2026-08-07T10:19:43.007032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00123","last_updated":"2018-12-01T02:08:38Z","snapshot_observed_at":"2026-07-06T07:18:22.588053Z","submitted_at":"2018-12-01T02:08:38Z","title":"Snapshot Distillation: Teacher-Student Optimization in One Generation","version":1},"cited_work":{"arxiv_id":"1812.00123","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.00123","snapshot_observed_at":"2026-08-07T10:19:44.242281Z","title":"Snapshot Distillation: Teacher-Student Optimization in One Generation","venue":"cs.CV","work_id":"c6b1c83c-c734-46e5-83b7-4acfb20c32fb","year":2018},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.092889Z"},"links":{"cited_paper":"/paper/1812.00123","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:4996efc9e043dca493af395f0236019bffa13ec16f5fe211aca067590a56e9a5","observation_id":"87977f5a-2953-48d6-aa83-22770c97d75b","resolution":{"observed_at":"2026-08-07T10:19:44.305382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-08T15:46:07.719139Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-07T10:19:43.250443Z","title":"On-policy context distillation for language models.arXiv preprint arXiv:2602.12275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.250443Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:105f30d382e70c5fcb08396f028612a7428fcd3197032baa2341e88342170470","observation_id":"cbaaed0d-6c3f-47f9-810d-868cc4bead47","resolution":{"observed_at":"2026-08-07T10:19:43.250443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-07T10:19:43.347186Z","title":"net/forum?id=T2TZ0RY4Zk","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.347186Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:532861c7ef534fd776b679713960c04276c21e7c7b09f5d1ea0873c2fd6fc8e1","observation_id":"bd14b0e8-7f9d-484b-841f-0b74a17ba5de","resolution":{"observed_at":"2026-08-07T10:19:43.347186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-05T03:08:42.211484Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-08-07T10:19:43.516621Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.516621Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:2b753ed5e7461eb6334ef13b9562efb1bfc3823d3469a8fea5ecc36a46d344b3","observation_id":"e37b18b6-0199-485d-863f-ee6df588524a","resolution":{"observed_at":"2026-08-07T10:19:43.516621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-07T10:19:43.698887Z","title":"Absolute zero: Reinforced self-play reasoning with zero data.arXiv preprint arXiv:2505.03335, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.698887Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:ca53f7b9967b8eeed4743b6f566c02d6794393c826e3ef0ea22c43fd0107e195","observation_id":"5f69390f-b506-483a-9d7d-9f611a7600fd","resolution":{"observed_at":"2026-08-07T10:19:43.698887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-07T10:19:43.764127Z","title":"Learning to reason without external rewards.arXiv preprint arXiv:2505.19590, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.764127Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:1fc3cfeb64edf12c186c068bdd1c8c51c95363c2f550f267eb461ee1a13e0369","observation_id":"08631336-b861-4564-ab57-28cf45aba4d4","resolution":{"observed_at":"2026-08-07T10:19:43.764127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:45.188510Z","title":"pub.” denotes the numbers published in the official OPSD repository; “ours","venue":null,"work_id":"74a46e82-4bab-48c9-bc0c-a730cd6bcbb3","year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.839213Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:f6493bbc4a03cf22b314bc82630c2bc22fec4dad05d5285d66068d629c820818","observation_id":"3acd0707-5d9d-425b-82d2-f8b27eb2a3fd","resolution":{"observed_at":"2026-08-07T10:19:45.236912Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-07T10:19:43.157443Z","title":"Self-distilled RLVR.arXiv preprint arXiv:2604.03128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.157443Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:b7f8e92e6f1e86a416cc5f1199ca2606dc3533eb400f680802136b683cc070ff","observation_id":"ceacb47f-efeb-4c0c-8e6a-932ff0750eef","resolution":{"observed_at":"2026-08-07T10:19:43.157443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-07T10:19:43.621441Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.621441Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:c1a5e2348b83865a0e81a05381baa06641daac9c3a17454c3cfa3a1309bbc470","observation_id":"9cfbb828-d21e-44c6-8a5b-d32ece739d6f","resolution":{"observed_at":"2026-08-07T10:19:43.621441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-07T10:19:41.490605Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.490605Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:4117a3683fdc2aadb74ffe912209438d1f8ac6d5e8891408d239063f91ce4ca6","observation_id":"125cc2a1-4970-4931-8111-eb1d3c01d637","resolution":{"observed_at":"2026-08-07T10:19:41.490605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-07T10:19:41.667277Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.667277Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:41cbf51c053fc5c921da88be383d70d2bb3240a409430269ae1c7c816eaaeb6e","observation_id":"8b6d3f6b-7b5d-4a83-afb4-79b6cf5f0262","resolution":{"observed_at":"2026-08-07T10:19:41.667277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T10:19:43.431632Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.431632Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:c12b72df7e0a60ab176b740ad7f9fe4087c202ad24a33b0021b6e4f4bfa7817c","observation_id":"2a38042b-66e7-4535-a4a0-aa0bd7eafc88","resolution":{"observed_at":"2026-08-07T10:19:43.431632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:19:41.249543Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.249543Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:59c32765581f6ea715d67f710d766df65eb3739e23d734813a85a41b6a78ddf3","observation_id":"49934ccb-49e9-4533-8497-46dfbd014348","resolution":{"observed_at":"2026-08-07T10:19:41.249543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:41.277301Z","title":"Serl: Self-play reinforcement learning for large language models with limited data.arXiv preprint arXiv:2505.20347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.277301Z"},"links":{"citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:f77e713a98ab982e34e9bf500ab70d10e104c08564e022923db4ce4a9f5bddbe","observation_id":"2a5413ea-f2e3-4e93-a015-1e7d2c3215b6","resolution":{"observed_at":"2026-08-07T10:19:41.277301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-07T10:19:41.381899Z","title":"URL https://arxiv.org/abs/ 2603.25562","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.381899Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:352df4e523784b6f4fa6c477f3794b471cfbb6769199a19adb5728f22411ebcd","observation_id":"2faf3dfb-1cba-4f8b-8eeb-6600154c7a29","resolution":{"observed_at":"2026-08-07T10:19:41.381899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:13:14.662030Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.06296."}