{"as_of":"2026-08-20T10:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21c417a0290fecca1bb074263da29ce1d4f06d666bd7581676427eab44bf405f","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:30:59.113734Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07935/citation-record","integrity":"/paper/2608.07935/integrity","json":"/paper/2608.07935/citation-record.json","paper":"/paper/2608.07935"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-15T14:30:58.977048Z","title":"arXiv preprint arXiv:2604.13016 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:58.977048Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:d0bf4255709ed1a093930eeca211b8f332a8f661bcd7181d5b73db3a13208944","observation_id":"eb3f397f-f4ce-4197-9582-bac4b4577755","resolution":{"observed_at":"2026-08-15T14:30:58.977048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T14:30:58.983083Z","title":"2023 , doi =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:58.983083Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:ac8d73283a121d3e6821b662a68a0d57ad81339abd9058091e046c7fcba53761","observation_id":"a4e7a171-046c-4ffa-8b7e-1d1ffe11b2e4","resolution":{"observed_at":"2026-08-15T14:30:58.983083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T14:30:58.987144Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:58.987144Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:7ae05507c5f2d7b13c6113372da52225ae486617facfdde13b842f649c25efa7","observation_id":"eedeb8b6-9be7-4c0a-8980-e152a72fdd7b","resolution":{"observed_at":"2026-08-15T14:30:58.987144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-15T14:30:58.990466Z","title":"arXiv preprint arXiv:2603.25562 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:58.990466Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:d9aa9f5d23ae352d0b161b6d20a319e0ba099d304364b59d79a7a9f4e8084fe8","observation_id":"c8e09a10-3630-47eb-8bc2-9e3b8dfa6624","resolution":{"observed_at":"2026-08-15T14:30:58.990466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-08-16T22:07:58.510827Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-08-15T14:30:58.993841Z","title":"arXiv preprint arXiv:2604.08527 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:58.993841Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:7f17923a26bb24a211d1e19090bb5bd60d67cd0a428841c8699fe0effbd341f2","observation_id":"9abe9b71-a7ee-4838-83fa-6d3f5db86210","resolution":{"observed_at":"2026-08-15T14:30:58.993841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.524862Z","title":"Findings of the Association for Computational Linguistics: ACL 2023 , pages =","venue":null,"work_id":"5d0972d5-dbe5-4086-afd1-75d5bb96cf80","year":2023},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:58.997553Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:c6469f754fa715df9f448dfe45da9dcad99c8fd6207906e990594eeebefb6f05","observation_id":"956f6187-967a-4791-a592-97e3edf3f998","resolution":{"observed_at":"2026-08-15T14:30:59.529142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T14:30:59.000910Z","title":"arXiv preprint arXiv:1503.02531 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.000910Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:149f0e63d62b7cc7ad7a7f5f53699cc0adee71ce6e23fdaa614f6116a54526df","observation_id":"6184d41b-a8a8-4b47-9dea-6f2c3a28a5bc","resolution":{"observed_at":"2026-08-15T14:30:59.000910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.513232Z","title":"International Journal of Computer Vision , volume =","venue":null,"work_id":"db75d316-a6c5-4680-9bc5-dc33e20026fe","year":2021},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.004494Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:1dea0f152c88fb7e41c85758b4200fb6199cc59b2976019e27427fc6a3539e6c","observation_id":"a55037bb-4c38-459a-9231-00a625671a58","resolution":{"observed_at":"2026-08-15T14:30:59.517092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.501724Z","title":"The Twelfth International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"8f05783d-5825-4b34-93ad-ba9f8c7adccd","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.007682Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:0da6d486cb4cc6490ccc41bbe1e9d63f982bb11d334bab70e22f4ef5a3513a2d","observation_id":"d95755b0-12bb-48e1-b83b-8cc663c3d1d1","resolution":{"observed_at":"2026-08-15T14:30:59.505303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.490156Z","title":"The Twelfth International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"92a9b87f-d78b-43eb-9869-64a927a8b254","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.011561Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:c5117d1614a9029d48b5f700aac4659a0aac9632a73634eda9025edf56be0492","observation_id":"1fb4efeb-2659-416d-9ad6-632848aa3bcc","resolution":{"observed_at":"2026-08-15T14:30:59.494010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-15T04:42:50.651833Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-15T14:30:59.015436Z","title":"arXiv preprint arXiv:2601.19897 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.015436Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:cbb20afc0400f73393211e60ccb1966b7e157ca000ddefeaf206789c2abb1add","observation_id":"f4027dd6-8e3b-44f6-8fad-000e178ce8b5","resolution":{"observed_at":"2026-08-15T14:30:59.015436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12400","last_updated":"2026-05-29T21:49:52Z","snapshot_observed_at":"2026-08-16T05:04:08.891684Z","submitted_at":"2026-05-12T17:00:53Z","title":"OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12400","snapshot_observed_at":"2026-08-15T14:30:59.018986Z","title":"arXiv preprint arXiv:2605.12400 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.018986Z"},"links":{"cited_paper":"/paper/2605.12400","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:f1afb7ef75da4c196b6a4a2bc615881d1397dabd557b8b3494e33e1a536f9769","observation_id":"297bf072-cc3d-4b96-a893-4347cdd737a3","resolution":{"observed_at":"2026-08-15T14:30:59.018986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.479639Z","title":"The Forty-second International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"f8d13f38-d81f-47a5-9b18-c8bb4fd14108","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.022798Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:c5cebb29aeab21da38314cf08aa0a69393ee64306423544353ecbf9551507f72","observation_id":"83a821ad-fa66-4253-8098-709a3f82df36","resolution":{"observed_at":"2026-08-15T14:30:59.483258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.468573Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , volume =","venue":null,"work_id":"7c98c6b2-96da-49e2-a437-23097909d69d","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.026426Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:9ebe3aa882a9e679d52e0af6a72e4f02f6a3d8beb3a6988d5ac712c33cfae005","observation_id":"803542d2-d62d-4886-a17a-8802722180e5","resolution":{"observed_at":"2026-08-15T14:30:59.472256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T14:30:59.029979Z","title":"arXiv preprint arXiv:2501.12948 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.029979Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:5f918ae246cb1e6a22186903e62d273b7aa44d00ddd96008fbcf0087892be078","observation_id":"71671b2e-43c4-4929-966c-f8484c4662bf","resolution":{"observed_at":"2026-08-15T14:30:59.029979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.456976Z","title":"The Forty-first International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"a3c0d131-1cb6-4ec3-b6e3-d99c8298df02","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.033615Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:c656902e3e6c62ccb813b13a6aec297c61c20fc5b5b5973fff7ae02d73b81ee1","observation_id":"2fad940e-17a3-45fb-bbe3-ea2bd141b3aa","resolution":{"observed_at":"2026-08-15T14:30:59.461038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.445834Z","title":"Rethinking K ullback- L eibler Divergence in Knowledge Distillation for Large Language Models","venue":null,"work_id":"f9ab5000-eab6-4cd2-a51f-e24283500231","year":2025},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.037234Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:cecd19e805100ad24a2de0118abb5aca4534429869275834aa06f86a384a535d","observation_id":"5c017229-56de-4653-94b6-953174184778","resolution":{"observed_at":"2026-08-15T14:30:59.449719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.409","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.143259Z","title":"T o D i: Token-wise Distillation via Fine-Grained Divergence Control","venue":null,"work_id":"6d0ef895-580a-4788-ae15-da6751791e5c","year":2025},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.041171Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:2b21c797438cc6bb2b7bd8a1a3d57177ab568b2d7c404642e39b000962c54a72","observation_id":"d4ab564d-b91b-404a-b529-91f9e9aa9181","resolution":{"observed_at":"2026-08-15T14:30:59.149627Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.045368Z","title":"Proceedings of the National Academy of Sciences , volume =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.045368Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:c08eafee0bf36a628f31d8a1e3bdc46041001ab3b739f51aafc5d8c6e6ad0a0e","observation_id":"99a2bd73-9554-4472-8c58-5d90eceae9d4","resolution":{"observed_at":"2026-08-15T14:30:59.045368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-08-16T00:12:56.001802Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-15T14:30:59.049773Z","title":"arXiv preprint arXiv:2308.08747 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.049773Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:3e491c00c1d94f409c0a33b42473813ffb29bf552b9fa3eee33302c43450af99","observation_id":"98e74a92-96df-48c8-a7e9-d85301fb13db","resolution":{"observed_at":"2026-08-15T14:30:59.049773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.426711Z","title":"The Fourteenth International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"f5ddedec-f234-4a20-aa0a-da3c60706883","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.054139Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:ede8ed8d4869b7f93a9d31b5617d5a4dfcdb0bc43e2de8aba2b1a7426d136356","observation_id":"be367df7-1f78-4904-9ed1-248876fa1083","resolution":{"observed_at":"2026-08-15T14:30:59.430401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.416892Z","title":"ACM Computing Surveys , volume =","venue":null,"work_id":"5383a86a-e658-4736-a6cb-516d9e1548ad","year":2025},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.057469Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:0aca56e451a8c9c8bb76422beb3bba96308cc16d530e4430d5665e7ad94a398c","observation_id":"14172cd3-6456-4450-bc4c-84de55663785","resolution":{"observed_at":"2026-08-15T14:30:59.420155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-16T22:58:22.322439Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-08-15T14:30:59.060832Z","title":"arXiv preprint arXiv:2509.04259 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.060832Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:3c199cff0224551dfcca32a69f6b288002ee01ad4e1f178164a65455e090dbf5","observation_id":"6554449b-7dd4-47c6-990d-6e071b94ffc1","resolution":{"observed_at":"2026-08-15T14:30:59.060832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18874","last_updated":"2026-06-26T02:22:44Z","snapshot_observed_at":"2026-08-12T17:11:52.723281Z","submitted_at":"2025-10-21T17:59:41Z","title":"Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18874","snapshot_observed_at":"2026-08-15T14:30:59.064521Z","title":"arXiv preprint arXiv:2510.18874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.064521Z"},"links":{"cited_paper":"/paper/2510.18874","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:df1461f45793e829531cfd8ea993fb1fe1d4627119d39d5311f2161afc0366ff","observation_id":"96cc048c-6a51-4d9d-8d19-c3c81990569e","resolution":{"observed_at":"2026-08-15T14:30:59.064521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-08-16T13:52:21.979655Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-08-15T14:30:59.068406Z","title":"arXiv preprint arXiv:2405.09673 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.068406Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:f0c313939ae5ced043f149e2a041f989b1d763581713385c7797a91233e4be74","observation_id":"e6dccabe-05af-4ba3-aa04-99d1bfdcf144","resolution":{"observed_at":"2026-08-15T14:30:59.068406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.407378Z","title":"2025 , publisher =","venue":null,"work_id":"dd76b9b0-68d2-4c75-9ea8-1f7c3184bf4d","year":2025},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.072416Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:1cd4a7bbb35fa03a6cc81da88530206496723cdc05b8dc9d2b23c390b2d5fcad","observation_id":"bd021fb8-4ca7-416d-8dbc-e14946274aa6","resolution":{"observed_at":"2026-08-15T14:30:59.410681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.396719Z","title":"2025 , publisher =","venue":null,"work_id":"283aa31f-daa7-483f-939a-16eb7210c6fa","year":2025},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.076481Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:19244f5142b461471543493c17c8d376e4663209df97b7a4d996a68041cd3d52","observation_id":"8a34036f-e070-4c2b-97e6-452a0c32e547","resolution":{"observed_at":"2026-08-15T14:30:59.400237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-08-18T05:31:28.924191Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-15T14:30:59.080228Z","title":"arXiv preprint arXiv:2306.05301 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.080228Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:9e6838ff31b910f741d400dde0e522822cb4e86875f9d989c364fb3f2403a112","observation_id":"b4b42150-e307-4c20-a796-dc0c7b587da5","resolution":{"observed_at":"2026-08-15T14:30:59.080228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.385764Z","title":"HuggingFace repository , howpublished =","venue":null,"work_id":"cac7cf0c-a987-4cf9-8875-f79ea3c8adec","year":2024},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.084064Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:0e7e5fe66746019952ed163c6c440c591dcf4775b8d85688d60cc57781a17428","observation_id":"c48d9b77-1d45-44db-b66e-cd2b7a044386","resolution":{"observed_at":"2026-08-15T14:30:59.389436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.087343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.087343Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:a97af26182fa6931b7493fc6fefd80b8d5578f029ed9649c270e161b1edf8d72","observation_id":"e0949940-0dab-46c0-9699-6ffd8bbff241","resolution":{"observed_at":"2026-08-15T14:30:59.087343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.368895Z","title":"The Twelfth International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"13ab93ae-93a6-4e95-81e8-d7f2e9a96069","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.090430Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:5c116eed159d229b9627418e163c3e4e2e79416f7042a39b8ed4b6e150268a96","observation_id":"9d625984-c4bd-48aa-a4ca-abcb1d48bcc3","resolution":{"observed_at":"2026-08-15T14:30:59.372655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.358602Z","title":"NeurIPS Datasets and Benchmarks Track , year =","venue":null,"work_id":"bbcfc8d6-86db-4e89-aea1-767e1987aeab","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.093520Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:b852139e1514f3e7f9e5ca7df60328bee84593942ed0c1c1e591a71862f5a790","observation_id":"9fe2c3ec-dceb-4408-8214-de40686100e5","resolution":{"observed_at":"2026-08-15T14:30:59.362082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T14:30:59.096546Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.096546Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:c649e1612b59fcd926d286af736e088ae46d434a0928c720d168b3d58f5048d8","observation_id":"e3bb0cdb-52cc-4ea7-8d3c-335e809e1257","resolution":{"observed_at":"2026-08-15T14:30:59.096546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-15T14:30:59.100287Z","title":"arXiv preprint arXiv:2601.18734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.100287Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:e814353c47b13118445a050eb9314101c96307fee6e51e951303e41db5245251","observation_id":"56ec0ebb-7dc8-4bf4-9d26-6610bf176eaa","resolution":{"observed_at":"2026-08-15T14:30:59.100287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:30:59.348344Z","title":"The Tenth International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"51967186-4bcf-412b-9049-74d4324e62f9","year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.103436Z"},"links":{"citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:e609ea38e2737cab8b2d6d3ab04b20a4cb3b38ede6ab9e03dd22215cee296c0e","observation_id":"01dcbd3a-9392-44ed-84f2-2192eedd7f14","resolution":{"observed_at":"2026-08-15T14:30:59.351887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T14:30:59.106642Z","title":"arXiv preprint arXiv:2505.09388 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.106642Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:ff3cbea62118d128c6db9dd05e8354a3d9dee1082432b05d6808164d32167ad2","observation_id":"4af330d0-18fa-446d-8941-f9aa0d809036","resolution":{"observed_at":"2026-08-15T14:30:59.106642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05517","last_updated":"2025-05-19T06:50:53Z","snapshot_observed_at":"2026-08-19T21:41:40.386018Z","submitted_at":"2024-08-10T11:00:13Z","title":"SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05517","snapshot_observed_at":"2026-08-15T14:30:59.109816Z","title":"arXiv preprint arXiv:2408.05517 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.109816Z"},"links":{"cited_paper":"/paper/2408.05517","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:5af7ec5617675dc87a5c302ce604006f013d6017cac88a868e4cb419feace715","observation_id":"8c843bf2-b5d4-4618-9bea-18a4fdfe7842","resolution":{"observed_at":"2026-08-15T14:30:59.109816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T14:30:59.113734Z","title":"arXiv preprint arXiv:1803.05457 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:30:59.113734Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.07935"},"observation_digest":"sha256:80dfbb197a6b3fa2adc779c1125c6c7cbc4481034df1966190a09f0c86a11e51","observation_id":"26c43321-8eea-41be-8b5a-a3315a8ea8d9","resolution":{"observed_at":"2026-08-15T14:30:59.113734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07935","last_updated":"2026-08-11T08:28:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T14:24:01.592546Z","submitted_at":"2026-08-08T05:46:32Z","title":"Adaptive Supervised Anchoring for On-Policy Self-Distillation"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.07935."}