{"as_of":"2026-08-20T02:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79ebf42bade9a42955e498da2f54a724f818b6c7d5e69003f30950be309000e0","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:38:13.138616Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:42:33.800620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":"2605.21606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-07T11:42:33.800620Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","venue":"cs.LG","work_id":"46b8ff35-4a75-451e-857f-4aaa8afb54db","year":2026},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-18T09:25:58.627127Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:32.520327Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:e444cf910d587fc6ad8cf4ff5e1fc24a084dfe1c0d7ef84d06b1c49549b3cd69","observation_id":"5061a2e3-591a-4f50-b92d-a1d213c2eee7","resolution":{"observed_at":"2026-08-07T11:42:33.823181Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-15T14:38:13.138616Z","title":"arXiv preprint arXiv:2605.21606 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06243","last_updated":"2026-08-07T03:26:12Z","snapshot_observed_at":"2026-08-18T09:25:58.627127Z","submitted_at":"2026-08-06T16:29:24Z","title":"DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:38:13.138616Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.06243"},"observation_digest":"sha256:24c00531262d43a82e5039b9b23c66a59171cd2aebcc07c580775ca04e868205","observation_id":"658e2172-3811-4392-90c3-fc95df007c96","resolution":{"observed_at":"2026-08-15T14:38:13.138616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-14T04:33:46.012744Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08726","last_updated":"2026-08-09T14:20:12Z","snapshot_observed_at":"2026-08-18T02:31:04.056561Z","submitted_at":"2026-08-09T14:20:12Z","title":"PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:33:46.012744Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.08726"},"observation_digest":"sha256:cbd8847a6462efe777b8f9ce1ef942ce397b2b07bb24e8534c5abafd75ece748","observation_id":"78962215-ea98-4859-997c-c87618b30e5f","resolution":{"observed_at":"2026-08-14T04:33:46.012744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-11T21:15:10.320052Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning.arXiv preprint arXiv:2605.21606,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-17T12:25:01.237741Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.320052Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:28e6932855f0efc9f49ced98030411db95337e18e4b85116d6ff0e5dad9737d8","observation_id":"93641fc3-d8f0-4cfa-92af-d7a1daac6cae","resolution":{"observed_at":"2026-08-11T21:15:10.320052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-11T11:37:45.789954Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-17T20:32:11.376024Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.789954Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:8a48d698486f211265892670189d03e6777904bf0a92c74833d9763afb6c79c6","observation_id":"4d54da7a-fdd5-47db-851e-8a444ce38a9f","resolution":{"observed_at":"2026-08-11T11:37:45.789954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-12T14:39:46.133085Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.133085Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:b61e17f236be426ffdbe5a3ab17ea7969ab471de31739dbaabf8e09b57170c28","observation_id":"1f5625a7-c50f-4681-b4f2-681ab274df17","resolution":{"observed_at":"2026-08-12T14:39:46.133085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.21606/citation-record","integrity":"/paper/2605.21606/integrity","json":"/paper/2605.21606/citation-record.json","paper":"/paper/2605.21606"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-16T15:21:35.471994Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":"2306.13649","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-07-09T21:06:34.855301Z","title":"Yoshua Bengio, Jérôme Louradour, Ronan Collobert, and Jason Weston","venue":"cs.LG","work_id":"78b7a553-fd43-4995-b559-e95779797d3f","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:ce66513fa9a3c01f7586ff7f1208d41b00bbe32e60f4d61d8c3932a9b82bfa40","observation_id":"e1b00854-c997-4f6d-8041-4e60a132fe5c","resolution":{"observed_at":"2026-05-22T09:26:20.558363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":"2407.21787","doi":"10.48550/arxiv.2407.21787","metadata_source":"pith","pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","venue":"cs.LG","work_id":"b124064d-5a56-42ad-86f5-3cc349b86a3a","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:6ae252b2096f12bf3c8f0798b597790aa7248c687f219f0de442afbb643ca263","observation_id":"e9fc52a0-cbc3-44a6-b223-884d58d2d376","resolution":{"observed_at":"2026-05-22T09:26:20.675333Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:b7c6971f6513a024645f43ab1d3eb07f9de636a0596a48e9eb7d280dc408f4ee","observation_id":"084288b1-51c7-4bf5-83ce-1eb6c32e3436","resolution":{"observed_at":"2026-05-22T09:26:20.690907Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-17T12:39:54.496393Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":"2605.00674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-07-10T09:37:00.861422Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","venue":"cs.CL","work_id":"a302077a-ac03-4988-adce-c84a57db5425","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:0cd7cc6c08b652077883276270f519f1c286a6bb568f29fdfd7edbba24ce2219","observation_id":"e45f07d4-d25b-426d-b98e-77a914080a57","resolution":{"observed_at":"2026-05-22T09:26:20.670596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02142","last_updated":"2016-10-04T16:50:26Z","snapshot_observed_at":"2026-08-17T19:37:04.082178Z","submitted_at":"2015-06-06T12:30:43Z","title":"Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning","version":6},"cited_work":{"arxiv_id":"1506.02142","doi":"10.48550/arxiv.1506.02142","metadata_source":"pith","pith_arxiv_id":"1506.02142","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning","venue":"stat.ML","work_id":"c73cadf6-1d84-47d1-8731-c654db78aee6","year":2015},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1506.02142","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:4f64d38b1b1c0a83b65f439ca7729bdc7e8ba041bc80b3d75a7068bd3f4cd261","observation_id":"dac29bf1-2efb-49da-acf6-e100d904aaab","resolution":{"observed_at":"2026-05-22T09:26:20.612385Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:38:06.250866+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T06:38:06.250866+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-16T00:37:04.298248Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":"2306.08543","doi":"10.48550/arxiv.2306.08543","metadata_source":"pith","pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","venue":"cs.CL","work_id":"16edb291-dd18-41c5-8486-c6c715ec5311","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:5b591871e98eaa99f57f03cb28117aaa1b2793325d44dce87254dce59e41c7cd","observation_id":"397d10ba-79d2-4991-8df9-fe25b7e49aff","resolution":{"observed_at":"2026-05-22T09:26:20.635842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-08-12T18:39:37.539896Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":"2305.15717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-07-04T05:09:36.906364Z","title":"The False Promise of Imitating Proprietary LLMs","venue":"cs.CL","work_id":"f843d86a-7fd6-4b0d-bf8b-f1ad3fbc3f04","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:e469f536e75b3e57e56114ac1814ed84a6d23991605adf0e6580d319cd81fa35","observation_id":"d00f2d7d-1451-4e7b-9f5c-43cf45b8ef17","resolution":{"observed_at":"2026-05-22T09:26:20.626055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-17T02:17:22.510859Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.04178","doi":"10.48550/arxiv.2506.04178","metadata_source":"pith","pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenThoughts: Data Recipes for Reasoning Models","venue":"cs.LG","work_id":"c7acbe41-27a0-4773-a7be-8f08d86cdf21","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:1ee3dbff27a4d919ae572fd6924f4136630af51631cd90cc07bee5be6db78b05","observation_id":"168463f7-bac6-45b2-b23c-623b824da29e","resolution":{"observed_at":"2026-05-22T09:26:20.645826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:48.169741+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:6abdeba03b3f4a0c9940fd7686d9ee67d570901defb12ec26f757432ebbe630c","observation_id":"3b46e933-62bc-4b56-a674-9aaa3ffb1f1b","resolution":{"observed_at":"2026-05-22T09:26:20.120857Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:e2fba089fe4a3ad0e983df48077c4d95c29bfcb8072e677eb27011ed9d28bb5c","observation_id":"224fe98b-bbe1-456f-bdd3-08947226e1cd","resolution":{"observed_at":"2026-05-22T09:26:20.650300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:9b51348c91413e29000ce43d81ed7c642b10f7a32f3e66696a59a8e7efaf7339","observation_id":"6a7b88eb-fdab-41d0-8b6e-02777a670fe7","resolution":{"observed_at":"2026-05-22T09:26:20.680236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"180e4370-b552-4f39-894c-275430a87867","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:9f78a57100be1ff88ac99be4257890e442a70b117ab55100781618c550c309ad","observation_id":"c37475fa-6569-4cf5-93d8-e53b7d8685ec","resolution":{"observed_at":"2026-05-22T09:26:21.014670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":"2603.07079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-09T21:06:34.837233Z","title":"Entropy-aware on-policy distillation of language models","venue":"cs.LG","work_id":"7dccbe12-e2aa-48d8-9b76-5521ccf02668","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:3a9563dd7bae6101a49e1d62e7c3a9058c35314a896232eccdce48cbf3e15e6d","observation_id":"d2262f10-4819-4e5f-9040-e1360fbc0213","resolution":{"observed_at":"2026-05-25T03:02:00.585154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.16297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:06:34.861145Z","title":"EMNLP 2025 (Oral)","venue":null,"work_id":"0b1eccee-481d-4561-8532-6dac9ed128da","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:a4c1fcc5b7c0d447ef5637bb6f45cbce7fab0fd3613194df718880de044b738a","observation_id":"203165bf-4adb-4c09-b9a8-6b4f7379d937","resolution":{"observed_at":"2026-05-22T09:26:20.603339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.07947","last_updated":"2016-09-22T01:17:12Z","snapshot_observed_at":"2026-08-14T21:51:10.458695Z","submitted_at":"2016-06-25T18:16:39Z","title":"Sequence-Level Knowledge Distillation","version":4},"cited_work":{"arxiv_id":"1606.07947","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.07947","snapshot_observed_at":"2026-07-04T17:40:00.736680Z","title":"Sequence-Level Knowledge Distillation","venue":"cs.CL","work_id":"81f47e08-b2fa-4722-9fab-dd97260b9002","year":2016},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1606.07947","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:397c7e5146ebfbaf34e144f06858b634253452be7998d6acd912d6c488507417","observation_id":"3d9f19e2-0fb2-4c23-82d1-1e5dad80bbf8","resolution":{"observed_at":"2026-05-22T09:26:20.621419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-19T13:05:26.034047Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:71fc3661cbdcdae6a35f73e70e391ca9ad3bafda3b4acb9da98027f30ae1c2a6","observation_id":"04227a4c-c5b2-412b-8eed-1fc2e91a6002","resolution":{"observed_at":"2026-05-22T09:26:20.581767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:35:48.689101Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":"5e961f0b-b20e-4580-965d-15fb63ec8965","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:0e41ccef13aa9ca73edb16f3bb2f758e2e9695a1fcfa78902155b638286ac8c0","observation_id":"9fddc1c8-0b74-4b04-a0fc-a0219e7497ad","resolution":{"observed_at":"2026-05-22T09:26:20.587894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:d2f13c3a9d1b308fdcad18cd2f8046b29a8e39d2458baed4d6af06a1321f6e54","observation_id":"ccdd2310-86f0-4a47-a25e-e61b8922d932","resolution":{"observed_at":"2026-05-22T09:26:20.608066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:6e7630962f0365b6ba4c61ee84850fd1dd57ce43a6fb40afe465ccd7ba42bb61","observation_id":"ecc40842-d050-42fe-b177-11204271031e","resolution":{"observed_at":"2026-05-22T09:26:20.655101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10501","last_updated":"2018-11-29T23:42:18Z","snapshot_observed_at":"2026-08-14T19:41:05.737672Z","submitted_at":"2018-02-28T16:06:19Z","title":"Predictive Uncertainty Estimation via Prior Networks","version":4},"cited_work":{"arxiv_id":"1802.10501","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.10501","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Predictive Uncertainty Estimation via Prior Networks","venue":"stat.ML","work_id":"a4bbbe04-21d9-4ab4-bf54-d0f33c59a631","year":2018},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1802.10501","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:0d056db5ddb34ffca366dcf8a944af4ce53d8c3eca7dcfdff69485d5afde022e","observation_id":"a56c2cd3-2102-4cb4-8f09-f626d15e2645","resolution":{"observed_at":"2026-05-22T09:26:20.665253Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:69b459fcd9d7d6d62c8759703638436a8656f26a7ea83c58c21116b96f9b8518","observation_id":"d71dc866-8bcc-4891-a612-20525bf47952","resolution":{"observed_at":"2026-05-22T09:26:20.640717Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":"1912.01703","doi":"10.1109/92.335012","metadata_source":"pith","pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","venue":"cs.LG","work_id":"c30b6d2c-7bb4-4ab0-8ef8-2015313610a9","year":2019},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:4e5a4c40d701d7bd3faad822ba2343ba836308253a55dad42d07fa807048353b","observation_id":"ac4ea3e4-f23d-4854-9f20-39b6c8dc4ba2","resolution":{"observed_at":"2026-05-22T09:26:20.575338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1011.0686","last_updated":"2011-03-16T18:51:21Z","snapshot_observed_at":"2026-08-15T05:04:07.152443Z","submitted_at":"2010-11-02T17:55:55Z","title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning","version":3},"cited_work":{"arxiv_id":"1011.0686","doi":"10.48550/arxiv.1011.0686","metadata_source":"pith","pith_arxiv_id":"1011.0686","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning","venue":"cs.LG","work_id":"73c02b0d-67bb-4f1e-900f-0241ff680534","year":2010},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/1011.0686","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:7603b7b49ca1bbbdce42666e74faeb335c98b0446df171317dcf75adda794155","observation_id":"f4579156-58ab-4351-9302-ea3c8fe35ef8","resolution":{"observed_at":"2026-05-22T09:26:20.631095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:8046faa038073f3e5142fc6c84e1badcc941a22adc8ae479e73828bcf8a1d6a3","observation_id":"f0d3af37-0312-4451-b81d-26208eafa069","resolution":{"observed_at":"2026-05-22T09:26:20.569518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:1c56fc39764220732030ae3f376fe3fb33dfd2c8d82960e84d07ef32b3c49fdc","observation_id":"98bcffc1-55b8-42bb-9c07-82fc5369f7fb","resolution":{"observed_at":"2026-05-22T09:26:20.563416Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15190","last_updated":"2023-07-27T20:39:06Z","snapshot_observed_at":"2026-08-19T20:26:32.298786Z","submitted_at":"2023-07-27T20:39:06Z","title":"f-Divergence Minimization for Sequence-Level Knowledge Distillation","version":1},"cited_work":{"arxiv_id":"2307.15190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.15190","snapshot_observed_at":"2026-07-07T12:33:45.185387Z","title":"f-divergence minimization for sequence-level knowledge distillation.ArXiv, abs/2307.15190","venue":"cs.CL","work_id":"8584197a-8520-4989-baa0-929e4caf14a3","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2307.15190","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:8afed15ff51cd9fe635ab2b2a5db007bf5d7c222aeb46b1a9423938b4466618e","observation_id":"045b2994-a9b6-499b-a0d2-ebb8b8588c31","resolution":{"observed_at":"2026-05-22T09:26:20.660266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":"46699579-9f31-4d7b-a61a-dcdc2a135181","year":2020},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:2b904e92aa655e736a88b871649d02e857ce91f34725bdeae039a3598871803b","observation_id":"33934696-fb15-45da-9f2a-131f6d1f7fc4","resolution":{"observed_at":"2026-05-22T09:26:21.011444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-demos.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.046980Z","title":"Transformers: State-of-the-Art Natural Language Processing","venue":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations","work_id":"801601a0-1077-41ef-a947-ba81c0b7510f","year":2020},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:e5cc8989ddb5855a96e18eff8400a812487c58f926a07a8b295db87a8adac5bd","observation_id":"8ffb5dd0-9f32-4c74-bd7d-9d47220fe44b","resolution":{"observed_at":"2026-05-22T09:26:20.138447Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:48.412582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:48.412582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02657","last_updated":"2024-12-08T13:03:38Z","snapshot_observed_at":"2026-08-17T03:33:43.544244Z","submitted_at":"2024-04-03T11:40:17Z","title":"Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2404.02657","doi":"10.48550/arxiv.2404.02657","metadata_source":"pith","pith_arxiv_id":"2404.02657","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models","venue":"cs.CL","work_id":"f39252a9-05e1-4512-8bd8-115180edf521","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2404.02657","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:0939456377f959ff59cd6b9dfcbbea93e77cecfbcbf6182481f03e0de7916b57","observation_id":"60698539-fa86-44a7-9110-f704c6dfb277","resolution":{"observed_at":"2026-05-22T09:26:20.593154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:9bd825b690736b153e199d798f60f244a4f7f8847857aef5303f87770548ff51","observation_id":"8634e864-6ec2-4ec1-a76c-44ed1be157fb","resolution":{"observed_at":"2026-05-22T09:26:20.616866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:ea4f8b54b604e8ffd9bad4088856cfa3b55b1de7023c30075955dfabc77fbef2","observation_id":"4c014472-8633-4e6b-a59f-28aed88e4919","resolution":{"observed_at":"2026-05-22T09:26:20.685869Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teacher” and “student","venue":null,"work_id":"f83c10f6-0dc0-43ff-9450-45498186d591","year":2025},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:86ede706c0d7947fff26b2b0730322b77d084a643c9b2d8c63c434c1bfbeb80f","observation_id":"26085573-124e-433a-a483-b1dc61ca8963","resolution":{"observed_at":"2026-05-22T09:26:21.031456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Problem attrition.Phase A samples 24 MATH-500, 30 AIME 2024, and 30 AIME 2025 problems (84 total)","venue":null,"work_id":"9aa698e4-6969-44a9-8cdb-d8c52feb251c","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:a8cc1f70aaeb29be376fb461e4705759700c1ae175fecc502d935cad48fde6d8","observation_id":"cf33928e-d7ea-417a-a2c2-b6f8581ecb63","resolution":{"observed_at":"2026-05-22T09:26:21.039069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85619fe1-4f77-42ec-8906-1c5285f507f1","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:1f96bc6193ccc2949d30f45bff7b0d0ffd7306a975183600e90a0480df904c00","observation_id":"9ea63ed9-cf64-45dd-a3da-e34fdd07da8f","resolution":{"observed_at":"2026-05-22T09:26:21.050522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2711ec6d-7998-44a5-b1ef-4c1eba290f35","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:5743ea0d93c29383aff3a8e27ced3a0d66489a942d9ea4441315813d67e0a8f7","observation_id":"5268a8c5-0d45-4927-9691-746f18d2d27a","resolution":{"observed_at":"2026-05-22T09:26:21.024626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Methods are compared on the same gap","venue":null,"work_id":"a337a5be-337b-4cee-bc3b-f167d692c1f8","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:22f613ff25bbc63db295e6b2706b6db4d523ffa4408d1473340c2763e72143b9","observation_id":"e6f477f6-82e0-49f8-afb3-6be669255dff","resolution":{"observed_at":"2026-05-22T09:26:21.028091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All methods are evaluated at the 100-step checkpoint, following the OPSD evaluation horizon of Zhao et al","venue":null,"work_id":"43624861-695f-4166-bf72-9793ab79d33d","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:25713dcd609093504459797a803456f10f4b66697ecaff7237980b54ef67a031","observation_id":"877bed36-b084-4b01-b4a7-5b9d9508f425","resolution":{"observed_at":"2026-05-22T09:26:21.042595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For each method–benchmark pair we run three random evaluation seeds (main, 1","venue":null,"work_id":"a50f11f7-77fa-45d3-a11a-1c89b1e65932","year":2026},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:6f4c1980757bdf09bf1b065f09ce23395ae03580778ff6a30bdeb16f13706e99","observation_id":"326b8426-dd98-4a0c-a4b1-421dc6370eb3","resolution":{"observed_at":"2026-05-22T09:26:21.018189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4d9d9aba-8899-4445-8827-aaf39309c0ca","year":2021},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:be812edd4bafdf617832619eb86a2758e14bdd563c65c5f3cc1a1cd00320711c","observation_id":"aa84a4d6-9ba4-4edb-a5fe-fb2ee45f668e","resolution":{"observed_at":"2026-05-22T09:26:21.021480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"per-sequence) by positioning (none vs","venue":null,"work_id":"a552750e-d4f8-42e9-8c3a-7a9fb601f08b","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:a7098849b5c1cbed22198102621f01d440e8a96b57a4f75badc257f0654fba86","observation_id":"3a1b1817-8ffd-4417-91b4-3785aee3cbe9","resolution":{"observed_at":"2026-05-22T09:26:21.034808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The two axes are complementary on AIME 2024 rather than independently sufficient","venue":null,"work_id":"ff0fa2c6-27c6-4ee3-9158-ecd65af5102b","year":2024},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:6cd8231f549d5ec73a90f5bbae13b88d4d6cfe2d81b58da7831cf67272228a3c","observation_id":"718e2ca2-5601-409b-9580-a8f10c4dfade","resolution":{"observed_at":"2026-05-22T09:26:21.046767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T11:52:58.877465Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":14,"parse_uncertain":0,"unresolved":4,"verified_exact":15,"verified_fuzzy":8},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 6 inbound Pith citation observations for arXiv:2605.21606."}