{"as_of":"2026-08-15T23:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edd1e572826481660584551ac1ab21843ca1bc627ef6927fe838fef5500af94a","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:37:45.802781Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09745/citation-record","integrity":"/paper/2608.09745/integrity","json":"/paper/2608.09745/citation-record.json","paper":"/paper/2608.09745"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-11T11:37:45.589820Z","title":"arXiv preprint arXiv:1503.02531 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.589820Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:dda2394aa1fd363e3577831c672f1cfdba88ae22798de7845c4638428b64bac7","observation_id":"2a0c1da9-216a-436a-8f49-2abfe2da5b58","resolution":{"observed_at":"2026-08-11T11:37:45.589820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.596529Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.596529Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:38fd3fe77aa9e466bd7c968143d30506ac519e04a734b57b3300c1127248261a","observation_id":"a5d1e3b5-5c44-443a-971f-06e1d622f539","resolution":{"observed_at":"2026-08-11T11:37:45.596529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.601327Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.601327Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:75525b4b7277867a375c49df6d6df129ccc83b8b46dbb488dfa419deb710c51b","observation_id":"638f7fd4-b921-4b1c-9ed4-42e207fda1f7","resolution":{"observed_at":"2026-08-11T11:37:45.601327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.606348Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.606348Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:cfdb5f45387f48ec894dd88b15bc102ec7041087346d7e0a0b5edb6e8f5c8a04","observation_id":"e1686b7b-3fa3-4b07-97df-b48eb9e99d75","resolution":{"observed_at":"2026-08-11T11:37:45.606348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.584796Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages =","venue":null,"work_id":"284ef726-9fbb-4a7a-b32b-b7b3e2a09cd5","year":2024},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.610931Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:979a1a0415bd4b08ff66f3ab4a8abef6cba6985af8e4e95e31a93935b6b21036","observation_id":"8144360d-7aeb-4750-97ca-b59d09c8d4c9","resolution":{"observed_at":"2026-08-11T11:37:46.589115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.615335Z","title":"Training language models to follow instructions with human feedback , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.615335Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:233204fb6a546ff3f1358f471f0864c3dd0ba60b4dfcccdc7fd2515852b97652","observation_id":"bf107687-ac74-4836-ba51-43a61140ae5c","resolution":{"observed_at":"2026-08-11T11:37:45.615335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.572674Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages =","venue":null,"work_id":"41b2a48f-c3b4-4706-819f-e862d2ff6489","year":2024},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.619439Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:5f448125e58f4450b4bdf1b525ecc6d7d3e002ca19a0b824440107a4b23a2607","observation_id":"871462bb-8507-47ad-aa1a-95072f0a2f31","resolution":{"observed_at":"2026-08-11T11:37:46.577052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-08-11T11:37:45.623399Z","title":"arXiv preprint arXiv:2604.00626 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.623399Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:19f533f9d2ebfd1145bb750fecf01dd65d3049f4120468d6de5eb5c9c2a24073","observation_id":"1d0b0bbb-651e-412a-8e05-3555b2760096","resolution":{"observed_at":"2026-08-11T11:37:45.623399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.627779Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.627779Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:3c7f0bee7b39ba0696c3703032708ce36bffe8569115fea1ce12b1e091ae978b","observation_id":"e2a8500f-823d-4dc0-843c-bd8af14f7bf8","resolution":{"observed_at":"2026-08-11T11:37:45.627779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.631798Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.631798Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:41b9e0ae7839c628e38517e0695b4e996537c895066e131e0d3dacc5fd06f91f","observation_id":"04a9dfca-32c3-4984-86c5-761fdf5d60c7","resolution":{"observed_at":"2026-08-11T11:37:45.631798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.635752Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.635752Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:58dce44c909499b6d7f3cfae42b2eb4a123e4b5c4ffc6c09d2691cde3e90bcb5","observation_id":"75bae3ba-2fce-44ad-8cfb-5ec748a84737","resolution":{"observed_at":"2026-08-11T11:37:45.635752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-08-15T18:08:07.785375Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-08-11T11:37:45.639541Z","title":"arXiv preprint arXiv:2603.05433 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.639541Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:155e53cdca8c818b1b9ffd006ad54632a469deaab5765ee03563eb1460503a9c","observation_id":"795d7368-ec21-4a92-94be-33a20756c3d9","resolution":{"observed_at":"2026-08-11T11:37:45.639541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.643746Z","title":"Thinking Machines Lab: Connectionism , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.643746Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:1d7fdcf90653bca40877f16f415388ad48da01bfd079e1d0c153903c593dcc5d","observation_id":"d0c7947b-2b55-4fee-b1d8-b5d9ecf7d20d","resolution":{"observed_at":"2026-08-11T11:37:45.643746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.526793Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"6e6ea748-f894-42a0-bee5-538072d5449c","year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.647555Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:2ce2b797319b8e1072b1225963120578d410ee75a8a5674244c0e25f3ab442de","observation_id":"1ebdb7a2-a54a-4304-ba0b-bdc514fd725f","resolution":{"observed_at":"2026-08-11T11:37:46.531270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-08-15T16:24:55.947978Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07865","snapshot_observed_at":"2026-08-11T11:37:45.651235Z","title":"arXiv preprint arXiv:2605.07865 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.651235Z"},"links":{"cited_paper":"/paper/2605.07865","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:65fdf79f8c7a9fdf917a8d33e51478273e64d87283d81a0c2760cd1a44405377","observation_id":"5f0a340a-0674-434b-8e0b-00dccc0edabb","resolution":{"observed_at":"2026-08-11T11:37:45.651235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.654871Z","title":"f-Divergence Minimization for Sequence-Level Knowledge Distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.654871Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:9cf233207cf8674d179e5f8b9ccb57e0873d6c061fe18b969f0dfb5845203ca6","observation_id":"114e1bdd-6e4d-4891-8e45-a9f1aac530ba","resolution":{"observed_at":"2026-08-11T11:37:45.654871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08741","last_updated":"2026-05-09T07:06:37Z","snapshot_observed_at":"2026-08-14T20:52:49.572748Z","submitted_at":"2026-05-09T07:06:37Z","title":"Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08741","snapshot_observed_at":"2026-08-11T11:37:45.658306Z","title":"arXiv preprint arXiv:2605.08741 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.658306Z"},"links":{"cited_paper":"/paper/2605.08741","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:f3cb440201671c1ff9bbb5059240791374c24ab36b25ab3cf7b75f95a9a927f2","observation_id":"7f186cf0-60c4-4c93-8264-0d2baa6627c6","resolution":{"observed_at":"2026-08-11T11:37:45.658306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-15T10:37:55.734735Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-11T11:37:45.662020Z","title":"arXiv preprint arXiv:2512.13961 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.662020Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:713b12f0da0d9831318e9911a6486a1117ca3514e3abd947908e899cf0a5ce4f","observation_id":"52e20e2f-3c56-4270-9cbd-b7a487be900c","resolution":{"observed_at":"2026-08-11T11:37:45.662020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.666095Z","title":"arXiv preprint arXiv:2406.09098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.666095Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:bc44f3a4c8da64d526703474f73dab36e405d65b12bd985944321cc65eee4008","observation_id":"c2a1c737-d4d0-4fe3-90e8-5b034017a67e","resolution":{"observed_at":"2026-08-11T11:37:45.666095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T11:37:45.669884Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.669884Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:d32f266c417d55071caa90f3a9459d4d2bd91c4f7c03d3974714f2d8b63897a2","observation_id":"08b57bfd-0733-436d-977b-eb77696e856c","resolution":{"observed_at":"2026-08-11T11:37:45.669884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.512014Z","title":"2026 , eprint=","venue":null,"work_id":"8c5bd6ae-26aa-45ba-9709-1447d77ff71e","year":2026},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.673838Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:79bef0e9e1fd90eb3ad3114d89c02d792a6bb411d816b67261c2d6c0e0c319b8","observation_id":"9d67e4e1-0f68-4e2e-96c4-56cb261c5f9e","resolution":{"observed_at":"2026-08-11T11:37:46.517390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.497805Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"4bb9dfba-7506-4e79-a532-2ad9e0185494","year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.677630Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:2e4c9e1676e67c7b9e44ceb38e10815939259a9babb46eceb689d95cb9927bde","observation_id":"f1b735b2-1bf2-4fc2-a998-e91f455c7128","resolution":{"observed_at":"2026-08-11T11:37:46.502797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.484603Z","title":"NeurIPS 2022 Workshop on Score-Based Methods , year=","venue":null,"work_id":"db93eb25-6551-456b-a568-5cfd252cc12d","year":2022},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.681224Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:53d8741b5f43b27c09c2f90f067518ed872f9c719ce13c27bd95b1270fc3fe77","observation_id":"2d29cf2f-f479-4bb4-8641-0ceac822b723","resolution":{"observed_at":"2026-08-11T11:37:46.489403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.471500Z","title":"2021 , eprint=","venue":null,"work_id":"4e4ecec9-d46c-4845-ac94-3660700f1727","year":2021},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.685181Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:69cb9df8e32976ec296a9a4df4eb205c756540cf53804499829cf6ff254b2bdc","observation_id":"982af3e4-99e5-4482-8353-5426477cad99","resolution":{"observed_at":"2026-08-11T11:37:46.476077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.459019Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"b45e663e-a060-4870-a635-b621120128af","year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.689364Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:a7bc819ee1a69d1d090ac5c298e0c05c8822a98b4ea67c07f375e4b70022dd8c","observation_id":"1e2bf75a-e64e-435e-807f-f9de4c990715","resolution":{"observed_at":"2026-08-11T11:37:46.463192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.445538Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"ae20b4bf-8930-4965-beb9-64a4f80572ac","year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.693379Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:1ff612fc2a57c9528660fd3cce9208f014cef217fdb0eab3841589a5e0a8df2d","observation_id":"87f9e36c-3d4a-4934-a7ec-b5cb6bfe161b","resolution":{"observed_at":"2026-08-11T11:37:46.450301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-12T23:31:10.409888Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-11T11:37:45.697264Z","title":"arXiv preprint arXiv:2602.12125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.697264Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:4de5fbc131cf3021d2daf112590375d28341be095140cc0f5cc43307630cb0c4","observation_id":"57b39698-9276-4409-9349-4ff22dec52f9","resolution":{"observed_at":"2026-08-11T11:37:45.697264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.432116Z","title":null,"venue":null,"work_id":"4fea89f2-41db-4c5b-a07a-987d899c1689","year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.701777Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:d6fb3f24fcb175ff6aae92b9ceef5fe7f64ed169bad6947c70e63f9b4a9626f0","observation_id":"1165b565-5af0-4b5f-9956-a5eefa9ceaee","resolution":{"observed_at":"2026-08-11T11:37:46.436791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.417366Z","title":"Reinforcement Learning from Rich Feedback with Distributional","venue":null,"work_id":"68ff8914-425c-449c-8813-fdb0de3000fb","year":2026},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.706513Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:60f4d7f4d0a67221451bb757637e6b5c6f52fae55f514b24876cb52e9e4170c2","observation_id":"b5dadfe2-772a-4aff-8823-509b52441d70","resolution":{"observed_at":"2026-08-11T11:37:46.422926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.402545Z","title":"Proceedings of The 33rd International Conference on Machine Learning , pages =","venue":null,"work_id":"9c34dfc4-271a-4d67-9866-807d2f87f680","year":2016},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.710529Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:abcbefce1045833445a4fead9589d3d9995ee1607f8842d61e88de440a9a9d59","observation_id":"205d1eae-b689-496f-a3e4-b7aca347cb51","resolution":{"observed_at":"2026-08-11T11:37:46.407500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.714282Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.714282Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:2987ad18a0d1d061a449e28f1843bbf2855fdfff8361040918b02002c68aa163","observation_id":"3d4c86ec-29e6-4178-b832-cb886a4a97cd","resolution":{"observed_at":"2026-08-11T11:37:45.714282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.381302Z","title":"2026 , eprint=","venue":null,"work_id":"bccc89a5-d134-4a77-9d9d-f1af7e930a07","year":2026},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.717500Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:9216f47f75e3e1d8765f5cd6e047ff7a21c1cebe9322038a3a183c9e3ef5d4ce","observation_id":"e561be1c-7421-46c4-8e1f-7e26dffeba64","resolution":{"observed_at":"2026-08-11T11:37:46.385370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.367536Z","title":"2026 , eprint =","venue":null,"work_id":"e2dc807e-b786-4ee1-a066-313001d9df9c","year":2026},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.720779Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:3d58b3a8395d72dde26bdc42d0ae0e5553b0a3ad670e4a26d0a26b4d16cde6a3","observation_id":"d7c386f3-d280-4a96-8acd-905513e4aff1","resolution":{"observed_at":"2026-08-11T11:37:46.372363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11458","last_updated":"2026-06-09T07:59:58Z","snapshot_observed_at":"2026-08-14T07:49:09.362637Z","submitted_at":"2026-05-12T03:15:58Z","title":"Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11458","snapshot_observed_at":"2026-08-11T11:37:45.724289Z","title":"arXiv preprint arXiv:2605.11458 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.724289Z"},"links":{"cited_paper":"/paper/2605.11458","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:0340378f291a2dc25bed1ba6fb2346cc7304dc0fb1631a6f0e3958d644b12852","observation_id":"75677fc8-b830-42ac-89ba-738d9070eccb","resolution":{"observed_at":"2026-08-11T11:37:45.724289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.353152Z","title":"2026 , eprint =","venue":null,"work_id":"62543813-a4cb-4f16-86e0-52d67d8325ab","year":2026},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.727793Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:21a22215a5f4b00864bc7a3e3f04e5035a5485bec18d347ec925854166249f3d","observation_id":"b4eb15aa-b3d7-443f-8672-f4d20a2f744a","resolution":{"observed_at":"2026-08-11T11:37:46.358425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11182","last_updated":"2026-05-24T01:43:21Z","snapshot_observed_at":"2026-08-13T17:31:40.872511Z","submitted_at":"2026-05-11T19:44:59Z","title":"The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11182","snapshot_observed_at":"2026-08-11T11:37:45.731585Z","title":"arXiv preprint arXiv:2605.11182 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.731585Z"},"links":{"cited_paper":"/paper/2605.11182","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:02b7d111d42c343edb314976061732adafb37b853af188821021fcc664b22f38","observation_id":"886fd386-99b6-4914-9d53-aa6784e1e253","resolution":{"observed_at":"2026-08-11T11:37:45.731585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.735838Z","title":"Proceedings of the 31st International Conference on Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.735838Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:c7826e1310d397c072d070a9332692c0d58afdfd689ebe0c9825ac889d22ba77","observation_id":"f4cf6336-f55a-4542-aed4-07cbb3224225","resolution":{"observed_at":"2026-08-11T11:37:45.735838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-08-14T19:39:25.088761Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13255","snapshot_observed_at":"2026-08-11T11:37:45.739459Z","title":"arXiv preprint arXiv:2605.13255 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.739459Z"},"links":{"cited_paper":"/paper/2605.13255","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:40ca6078e4c03ea1a28bde176655e69cec7c02c88b7032b6778618756c711d4d","observation_id":"f435979a-ebd0-4628-b212-5605e6bb6d91","resolution":{"observed_at":"2026-08-11T11:37:45.739459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-11T11:37:45.743478Z","title":"arXiv preprint arXiv:2602.04942 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.743478Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:7a64bf8f49eed14310215c874e66a6d56b5737782af76ab15ba4390881a98eb6","observation_id":"cf81325e-f6c6-49b4-98f6-d0a18497a1a4","resolution":{"observed_at":"2026-08-11T11:37:45.743478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.747259Z","title":"Proceedings of the 32nd International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.747259Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:c8afb3d11deb325c03af8caf66242cc6494d91dc7dd5af4e82dc18d2053b8496","observation_id":"d28ecf74-189d-40ad-8a36-fa36581bd108","resolution":{"observed_at":"2026-08-11T11:37:45.747259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T11:37:45.750809Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.750809Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:200319e5abe4801f064fce46c96378378ab14f7c875115f45329bb70d752f4c3","observation_id":"38e485e6-fa2d-4efa-954b-0fd1cab51bb1","resolution":{"observed_at":"2026-08-11T11:37:45.750809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T11:37:45.754959Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.754959Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:4c38ff2f6eeaefcb3b333eb608e3561e92a25e29faf21e715fd2ffa41a7dc409","observation_id":"e095d125-277b-42cc-9845-3a59e9897e8b","resolution":{"observed_at":"2026-08-11T11:37:45.754959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.758927Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.758927Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:4b3c558f49a64bba56e4247ec35f36ecd4cdc57be61471c325fda14691b22ad0","observation_id":"14a231d7-7b8a-45f5-a632-083625194588","resolution":{"observed_at":"2026-08-11T11:37:45.758927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-13T16:04:46.474244Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-11T11:37:45.762479Z","title":"arXiv preprint arXiv:2306.08543 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.762479Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:0f2c980cc9d32d38f14461d3735d81f1ad4f62f8b36ea96cc2ce9e04fd54a38c","observation_id":"5f90f6da-8994-41a8-a5a5-89c9ff4e31bf","resolution":{"observed_at":"2026-08-11T11:37:45.762479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.767073Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.767073Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:96a951b77fb97a41fe11700ffea9b76a6fbbd91266bea90bca68f6a9fbcf78e8","observation_id":"1c1428b8-02c6-4557-8544-e88b20ae5e67","resolution":{"observed_at":"2026-08-11T11:37:45.767073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-13T16:28:18.700523Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-11T11:37:45.770702Z","title":"arXiv preprint arXiv:2602.12275 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.770702Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:00902cbf58e2edab9a78004f15c4c3d2f90cd0cf039fb238f7c950c1361cf0d2","observation_id":"cd8dd265-a70e-4df9-a4f0-073a91696aa5","resolution":{"observed_at":"2026-08-11T11:37:45.770702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:46.307058Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":"65ebff0c-b50b-4c6f-9b06-2afc8c0a0bed","year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.774509Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:c269fc1345b964ed71e35b3a3eca112a5576f9c9c02ca4767bbed7101f3a522a","observation_id":"a7eea293-6c5b-4417-9582-fad4076de71d","resolution":{"observed_at":"2026-08-11T11:37:46.312822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.777788Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.777788Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:1db3fbd045410cb37d2f193e071bf3f20f18b7f111ee26e3350405d676d7f6c4","observation_id":"863b6e4a-c642-471f-a523-f29a470235ff","resolution":{"observed_at":"2026-08-11T11:37:45.777788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:45.780946Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.780946Z"},"links":{"citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:2a6146b661736d90c457bdc3dff03627aacd245695ad8eed35b17d3ca688efe4","observation_id":"da8176f6-2823-4517-86df-c0939f93fcf3","resolution":{"observed_at":"2026-08-11T11:37:45.780946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-11T11:37:45.785460Z","title":"arXiv preprint arXiv:2603.07079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.785460Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:9fc7623d532beec0d53848b04658d999170ffb93fab5b0f5b217859c4cad3f9c","observation_id":"037c42a0-b5f9-4c8c-8688-056cc1968ece","resolution":{"observed_at":"2026-08-11T11:37:45.785460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-11T11:37:45.789954Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.789954Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:4fab7f3f1b7410f8cb8d43bcbd3affd8b656ea65bfd28e650945685b365a80df","observation_id":"4d54da7a-fdd5-47db-851e-8a444ce38a9f","resolution":{"observed_at":"2026-08-11T11:37:45.789954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03532","last_updated":"2026-06-02T11:54:39Z","snapshot_observed_at":"2026-08-02T05:40:29.244990Z","submitted_at":"2026-06-02T11:54:39Z","title":"When Should the Teacher Move? Temporal Coupling and Stability in Self On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03532","snapshot_observed_at":"2026-08-11T11:37:45.794287Z","title":"arXiv preprint arXiv:2606.03532 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.794287Z"},"links":{"cited_paper":"/paper/2606.03532","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:c3369237a9440fef379be31ed7eb86c0dacedb84f24cba1c09cca394fe069f97","observation_id":"8f69d0f0-3bf7-4ea1-873f-92a63444e440","resolution":{"observed_at":"2026-08-11T11:37:45.794287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-08-11T17:07:33.755866Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-08-11T11:37:45.798504Z","title":"arXiv preprint arXiv:2604.08527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.798504Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:5b74a4afa361fb270d4d7a5c76caa0d85968d9824823e3b71c9fd04bdff967f5","observation_id":"83b95108-fd09-45a7-8b1a-1fe6f47a91ea","resolution":{"observed_at":"2026-08-11T11:37:45.798504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-08-13T22:55:34.534879Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-08-11T11:37:45.802781Z","title":"arXiv preprint arXiv:2605.05040 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.802781Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:42de00f78a2ff9ffd2748c9eed1fdca70b365b7e166bbd1804bca7bc624dc50f","observation_id":"18503dd2-0212-4818-b9eb-4b32f0eb860b","resolution":{"observed_at":"2026-08-11T11:37:45.802781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T20:19:30.771221Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2608.09745."}