{"as_of":"2026-08-16T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f2aefc0c360152f242cf3307fa02957e8affe9e160e0a75eaad6509bd92aa7d","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:15:10.410698Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09228/citation-record","integrity":"/paper/2608.09228/integrity","json":"/paper/2608.09228/citation-record.json","paper":"/paper/2608.09228"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.923897Z","title":"This intervention removes padding from the boundary between the prompt and response","venue":null,"work_id":"c5da3e1d-3bad-4ef0-865d-c81032a83c95","year":2025},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.379556Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:0580c5e8d8074ba5ecd7547f94d339d063f859ec4fa9f0ddcc2a2775ee98533b","observation_id":"289b7133-b041-4fcd-9451-6e1e67894a87","resolution":{"observed_at":"2026-08-11T21:15:10.929328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-11T21:15:10.301138Z","title":"doi: 10.18653/v1/2023.findings-acl.507","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.301138Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:973bc863c9345f27ef377efbec21c54f1b7a9ff2d29ef188b5f8f6daa040e4a7","observation_id":"a2cf4d47-f515-40fc-8dca-1d81a63d63d0","resolution":{"observed_at":"2026-08-11T21:15:10.301138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.940755Z","title":"Yoon Kim and Alexander M","venue":null,"work_id":"dc6b4bdd-2957-4a21-bb6f-c702d42af50a","year":2016},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.310699Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:5963dd8337386ed7e1992b76d648cd8e4490ecaeaa2f8f0ee6c1628b9a792c22","observation_id":"913f08a7-c15d-4fee-b888-f3d2ac9641ae","resolution":{"observed_at":"2026-08-11T21:15:10.945412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-11T21:15:10.320052Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning.arXiv preprint arXiv:2605.21606,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.320052Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:68db1459c3bb173c49ba9fc24173bfdc0d2ce4e5af613431ca925dcbdfa3d650","observation_id":"93641fc3-d8f0-4cfa-92af-d7a1daac6cae","resolution":{"observed_at":"2026-08-11T21:15:10.320052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.03643","last_updated":"2016-02-26T02:21:52Z","snapshot_observed_at":"2026-08-14T22:23:51.094757Z","submitted_at":"2015-11-11T20:27:54Z","title":"Unifying distillation and privileged information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03643","snapshot_observed_at":"2026-08-11T21:15:10.324593Z","title":"Unifying distillation and privileged information.arXiv preprint arXiv:1511.03643,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.324593Z"},"links":{"cited_paper":"/paper/1511.03643","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:f45ad9f1f9bcea00f033d93b4efbd36efa2d35907c3b0f456a084a7a496a5f00","observation_id":"5f1394af-238b-4ce4-9812-d7ab594ad747","resolution":{"observed_at":"2026-08-11T21:15:10.324593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.851606Z","title":"=== Unrelated physics Worked Example Solution End === Now solve the target mathematics problem independently","venue":null,"work_id":"dcb05ebc-bbe3-497b-a6d2-63022245d6ca","year":2024},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.398242Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:7799399bee726e7ff0501742fea1b720d72ea202a0ce28d1b7d991e87a9c1a08","observation_id":"4b3c1bcd-3bf3-44f0-923a-6763601a7465","resolution":{"observed_at":"2026-08-11T21:15:10.858063Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02234","last_updated":"2026-07-02T14:33:07Z","snapshot_observed_at":"2026-08-12T11:57:55.007718Z","submitted_at":"2026-07-02T14:33:07Z","title":"Purified OPSD: On-Policy Self-Distillation Without Losing How to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02234","snapshot_observed_at":"2026-08-11T21:15:10.339155Z","title":"Purified OPSD: On-Policy Self-Distillation Without Losing How to Think.arXiv preprint arXiv:2607.02234,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.339155Z"},"links":{"cited_paper":"/paper/2607.02234","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:9c2e4042c945c1b3945ea557e24baa928cc2c3c2802f6195998551d7392549ce","observation_id":"a49989b8-9b31-4f9c-8a5b-de603543aca6","resolution":{"observed_at":"2026-08-11T21:15:10.339155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-15T04:42:50.651833Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-11T21:15:10.343847Z","title":"Self-Distillation Enables Continual Learning.arXiv preprint arXiv:2601.19897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.343847Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:3ffa6be96aad0611d9b4aee1149a949c881bfcd3b2c451427760698c779d96bc","observation_id":"215f035b-df78-4d83-9023-82d08f1a45e7","resolution":{"observed_at":"2026-08-11T21:15:10.343847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-13T14:15:52.124827Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-11T21:15:10.349346Z","title":"Learning by distilling context.arXiv preprint arXiv:2209.15189,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.349346Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:91ac8b07b9f11bf185162afaac2d2f446315a2968799da444d2679c1458bec35","observation_id":"65c605b8-ecdb-4f37-8f80-590cb4478592","resolution":{"observed_at":"2026-08-11T21:15:10.349346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-11T21:15:10.360395Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.360395Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:69a94b0e73ab97a257937f3785dd83a5ef1d9a1daa2d9206746961402fcb0a66","observation_id":"56a760fc-a489-4c2d-9e4c-91e1a30daa99","resolution":{"observed_at":"2026-08-11T21:15:10.360395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-13T16:28:18.700523Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-11T21:15:10.370271Z","title":"on-policy context distillation for language models.arXiv preprint arXiv:2602.12275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.370271Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:3bee9e177e01909c67c1e24211b842c50e61b74a8a0e7e19f1834ac28b05205e","observation_id":"f8dffb3d-058c-45d7-a677-0d401cf8bcaa","resolution":{"observed_at":"2026-08-11T21:15:10.370271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-08-13T01:43:27.853141Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-08-11T21:15:10.374470Z","title":"ISBN 9781713871088","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.374470Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:e69cfdff43efbdc6763afa887ddbd6c40830b462e57942e263e3b57155267ca1","observation_id":"1cad0b44-4162-4ad5-9a32-e7fa5d542e1d","resolution":{"observed_at":"2026-08-11T21:15:10.374470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.906465Z","title":"We evaluate checkpoint 100 with 12 samples per problem and 4 seeds","venue":null,"work_id":"8a4d0dd7-9708-44f1-a73b-c9813c6dc7c0","year":2026},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.384381Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:f53558081f92a0445e0ca01476b32db0e21ab19750bf5a3b5184e85fc668682a","observation_id":"82017f4e-f851-48db-b75a-d1367e38c463","resolution":{"observed_at":"2026-08-11T21:15:10.911304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.889124Z","title":"The 400- update checkpoint obtains 51.39 Avg@12, a decrease of 3.96 percentage points from the 100-update result","venue":null,"work_id":"7c07e06a-324f-4059-983a-af32e2836546","year":2026},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.388984Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:8c6dbad62585bf9eb87c5584872ccf8fadcfd86254db05b08a77dded6069edc8","observation_id":"e0acbcb2-d916-4147-a91b-0613fac6f896","resolution":{"observed_at":"2026-08-11T21:15:10.894673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.871237Z","title":"Accuracy metrics are four-seed means in percentages","venue":null,"work_id":"a533052f-9a08-409b-a2a1-55dbcf59af4f","year":2024},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.393371Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:d22219b3b28c3b0f6aa363f8b68a40e3c41097a2ce62530a58837b5e40d0ec1c","observation_id":"ee8a5264-8611-4607-9e65-6262474215a8","resolution":{"observed_at":"2026-08-11T21:15:10.876799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.833791Z","title":"This result does not isolate which property of the physics context causes the decline","venue":null,"work_id":"1dac378f-fabf-4bff-9101-60c4e8f50d55","year":2024},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.402404Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:09835cee62de9c16f2639b693d0b78215cc380b4c7d22a35c29b5007989fccd5","observation_id":"8923c618-04c7-4de5-8085-4037227fe6eb","resolution":{"observed_at":"2026-08-11T21:15:10.838957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.816596Z","title":null,"venue":null,"work_id":"4a370183-7b2b-4561-9e30-34388a256316","year":2024},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.406672Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:5853fcf07534110f369d5f62d0db2900f17e6ea50130753b5f4b0cf48c5646d4","observation_id":"2a3e21ae-e6e8-48f8-858f-f63b60db8495","resolution":{"observed_at":"2026-08-11T21:15:10.822130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.798549Z","title":"It also matches or exceeds target-solution OPSD on all three benchmarks","venue":null,"work_id":"ce602c92-6bf7-41ef-bc45-b691c7f88a51","year":2024},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.410698Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:fadb925e461e23d7ea1db612de13f21558b2d28ebd6e4f3fa6cb7777f156b1ca","observation_id":"a878075b-e5a3-41e1-acba-5dc2a1bb4559","resolution":{"observed_at":"2026-08-11T21:15:10.805032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T21:15:10.365657Z","title":"doi: https://doi.org/10.1016/ j.neunet.2009.06.042","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.365657Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:b0218154be08fbfa6f9b4eadc773875548cee839df69c3fd631a2ca44da0344f","observation_id":"07df70a2-eafa-4fd1-b63a-c61c94d92346","resolution":{"observed_at":"2026-08-11T21:15:10.365657Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.971636Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":"e7de1009-61cf-4924-a554-310c3a2305cc","year":2023},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.295922Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:3b282f79b9cea08ee79ac9c6f90c78df0f359c66a4bda76f070704730d97ef1c","observation_id":"973a32d7-b7c9-4f0c-bb57-b5dd8aa64301","resolution":{"observed_at":"2026-08-11T21:15:10.976532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.329334Z","title":"Semantic soft bootstrapping: Long context reasoning in llms without reinforcement learning.arXiv preprint arXiv:2512.05105,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.329334Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:01bede86a49f18d0017876fbcb0831ceeee2a84abd07f5e8de74b59f8fa86346","observation_id":"51c3de20-fd9e-43db-9911-ddcfcac2fcbd","resolution":{"observed_at":"2026-08-11T21:15:10.329334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.315535Z","title":"doi: 10.18653/v1/D16-1139","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.315535Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:f43fd21a5c30a18d9f61d03eb8346d5502794e7f695fbea16b74a0b038c9396c","observation_id":"04ea44fc-ce86-4ab1-983d-6f21bdc734d8","resolution":{"observed_at":"2026-08-11T21:15:10.315535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17497","last_updated":"2026-05-17T15:14:24Z","snapshot_observed_at":"2026-08-15T19:35:05.302488Z","submitted_at":"2026-05-17T15:14:24Z","title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17497","snapshot_observed_at":"2026-08-11T21:15:10.355139Z","title":"Self-Supervised On-Policy Distillation for Reasoning Language Models.arXiv preprint arXiv:2605.17497,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.355139Z"},"links":{"cited_paper":"/paper/2605.17497","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:b423ac7f6cb5adf595c972ff68e8f79a234e2f252b21cadd6aadb2e33e8bf64f","observation_id":"cbdf8099-a0f5-4958-b907-30d8f3ff5d34","resolution":{"observed_at":"2026-08-11T21:15:10.355139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-11T21:15:10.291175Z","title":"URL https://doi.org/ 10.48550/arXiv.2308.08998","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.291175Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:1637efe5dd8491ff06fd0643bd9b7a807ada2a47b0002d50a2a4ad185e42219a","observation_id":"b3271aa9-2334-4dec-957a-860c3b0f2b52","resolution":{"observed_at":"2026-08-11T21:15:10.291175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-11T21:15:10.286057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.286057Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:6c7f8b82c13cce3e024a5be368bfefb93f5de69f0160318565a57ac5e5ef7a31","observation_id":"33f7e73b-fbbc-49df-a72a-74ac66dffd86","resolution":{"observed_at":"2026-08-11T21:15:10.286057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-11T21:15:10.334200Z","title":"Privileged Information Distillation for Language Models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.334200Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:bde9c01e84cb4e38d8febd1a77a7c81cfb562036d0e7462cc979f9e551a3a778","observation_id":"c974849f-93cb-4426-bf4e-9ba3419b14f9","resolution":{"observed_at":"2026-08-11T21:15:10.334200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:10.956337Z","title":"Rethinking On-Policy Self- Distillation for Thinking Models","venue":null,"work_id":"8fd687e1-1d56-4e13-8300-adf5b16bf928","year":2026},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.306241Z"},"links":{"citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:ff1bf2416378b6f698578a282423fbaa3fc99cd2510f5a0949fe9fad29b56ddd","observation_id":"43963a1e-13a9-4894-bca5-87684ed99c42","resolution":{"observed_at":"2026-08-11T21:15:10.961771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T16:50:16.370694Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2608.09228."}