{"as_of":"2026-08-19T02:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba9fb03acbaabc84056d48bb19bb2d4a9791c6d8a6e0bbd9c155dd478b6783f9","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:57:51.075050Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09826/citation-record","integrity":"/paper/2608.09826/integrity","json":"/paper/2608.09826/citation-record.json","paper":"/paper/2608.09826"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-08-11T06:47:39.541564Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-08-11T05:57:50.994951Z","title":"Jiang,Y.;Li,D.;Deng,H.;Ma,B.;Wang,X.;Wang,Q.;and Yu,G.2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:50.994951Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:8881197aa5404854489bd64d8ccde5b0f005a10681155a36cc1d80efea9f9168","observation_id":"6ba62059-8747-4625-a908-af4364bfbe6c","resolution":{"observed_at":"2026-08-11T05:57:50.994951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-11T05:57:51.002061Z","title":"arXiv:2603.07079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.002061Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:db8ec2bf5d25dbc2aef18cf40bbcd489a893b7f40040637b303653cdb248bb2e","observation_id":"4f8ac343-3629-46c1-a33f-6d7448a3298e","resolution":{"observed_at":"2026-08-11T05:57:51.002061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-11T05:57:51.017525Z","title":"Liao, H.; He, S.; Hao, Y.; Li, X.; Zhang, Y.; Zhao, J.; and Liu, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.017525Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:fc1b7f33b3a48e97ef2dae4798c24eb17a708ea9aa96b6379e64bf6cfe14d10e","observation_id":"04e77260-9a20-408f-8ee9-8fbe1360e585","resolution":{"observed_at":"2026-08-11T05:57:51.017525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:57:51.379936Z","title":"InInternational Con- ference on Learning Representations, volume 2024, 39578– 39601","venue":null,"work_id":"3c693720-210f-468c-ba3c-391c3463d82a","year":2024},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.021814Z"},"links":{"citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:fde3eb2a2fc2e406ad23e30ee268668a425a0fd20d824759feac74795c2beed2","observation_id":"fe98a91a-b63a-46ce-9cba-d6518db871bd","resolution":{"observed_at":"2026-08-11T05:57:51.384107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:57:51.030096Z","title":"Nam, T.; Sun, S.-H.; Pertsch, K.; Hwang, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.030096Z"},"links":{"citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:128c8149d1176a436dca27725218c9081a44aaee4142776332db79b29618b6f9","observation_id":"83618215-19e0-45f4-a1b5-4f4b6aa7dfde","resolution":{"observed_at":"2026-08-11T05:57:51.030096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11828","last_updated":"2022-04-25T17:58:19Z","snapshot_observed_at":"2026-08-16T17:04:43.292878Z","submitted_at":"2022-04-25T17:58:19Z","title":"Skill-based Meta-Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.11828","snapshot_observed_at":"2026-08-11T05:57:51.033925Z","title":"Penaloza,E.;Vattikonda,D.;Gontier,N.;Lacoste,A.;Char- lin,L.;andCaccia,M.2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.033925Z"},"links":{"cited_paper":"/paper/2204.11828","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:ec7c4afecc0f0a9c0445ddb63e591ff8d3968fc66840f9d54099805b48856f41","observation_id":"b7a4e63d-38d9-4e0c-9d03-483c4181436f","resolution":{"observed_at":"2026-08-11T05:57:51.033925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T05:57:51.038075Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.038075Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:6cc3cb4ffeba85970b99541eb548e8bb44e6f2164fb6c4c4fa4174c1c0c99a6a","observation_id":"74c6dd90-6804-4140-8cff-c30037ed0391","resolution":{"observed_at":"2026-08-11T05:57:51.038075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07560","last_updated":"2022-12-11T17:56:12Z","snapshot_observed_at":"2026-08-16T16:45:40.310239Z","submitted_at":"2022-07-15T16:06:33Z","title":"Skill-based Model-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07560","snapshot_observed_at":"2026-08-11T05:57:51.042725Z","title":"Snell, C.; Klein, D.; and Zhong, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.042725Z"},"links":{"cited_paper":"/paper/2207.07560","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:3efeb7d25e0fc26292a6b9658d8e70d1087c78f62140e1981d4f555af449e8c1","observation_id":"0c257387-727d-4507-a38e-e0064d82d088","resolution":{"observed_at":"2026-08-11T05:57:51.042725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-16T16:27:58.798107Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-11T05:57:51.046808Z","title":"arXiv:2209.15189","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.046808Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:58c5bac7992dceb876f1bde3b39a710ab0b3821e0c038f56de4169ee43292808","observation_id":"d355fa74-b0e1-4ff6-a014-c3ee91c4fbb9","resolution":{"observed_at":"2026-08-11T05:57:51.046808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-18T16:44:14.964518Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-11T05:57:51.055042Z","title":"arXiv preprint arXiv:2604.10674","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.055042Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:f0034219fb09c979f966bf83f20bda2159129e7061f6ba363fd8b86502e139e5","observation_id":"c01aace5-e8f3-4764-a66e-af538adb1447","resolution":{"observed_at":"2026-08-11T05:57:51.055042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12430","last_updated":"2026-06-02T16:14:54Z","snapshot_observed_at":"2026-08-06T11:11:16.632352Z","submitted_at":"2026-02-12T21:33:25Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12430","snapshot_observed_at":"2026-08-11T05:57:51.059264Z","title":"Xu, X.; Li, M.; Tao, C.; Shen, T.; Cheng, R.; Li, J.; Xu, C.; Tao, D.; and Zhou, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.059264Z"},"links":{"cited_paper":"/paper/2602.12430","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:9874fffa7ef49794a182e0e6c977ec138fe99aadeb7d9f8c0e1e8f786036ae6a","observation_id":"1ea6ecc2-2dfb-41ee-8fd8-45873a489136","resolution":{"observed_at":"2026-08-11T05:57:51.059264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-11T05:57:51.063267Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.063267Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:c5055ac2f0428e6beaa5d4fe207b88473082e582e53b4c91a7be9bd76c5ae6eb","observation_id":"3d608ef9-024e-4b91-9396-5790c6e51917","resolution":{"observed_at":"2026-08-11T05:57:51.063267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-16T08:35:41.330991Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-11T05:57:51.067414Z","title":"Ye,H.-J.;Lu,S.;andZhan,D.-C.2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.067414Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:92900f0c7758a734b1c568b27b62fc54d7ef68bfcbe1ad9c318afee8cfb532f4","observation_id":"91918b64-a48b-4a63-b639-a8d3dccac5e1","resolution":{"observed_at":"2026-08-11T05:57:51.067414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17535","last_updated":"2026-04-19T16:53:56Z","snapshot_observed_at":"2026-08-13T17:23:59.909337Z","submitted_at":"2026-04-19T16:53:56Z","title":"OPSDL: On-Policy Self-Distillation for Long-Context Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17535","snapshot_observed_at":"2026-08-11T05:57:51.071097Z","title":"Zhang, Y.; and Math-AI, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.071097Z"},"links":{"cited_paper":"/paper/2604.17535","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:c632c0288610aaaca16629d9f1de39478b4e961a8117ef5a7fe65ec593312167","observation_id":"d568653b-c3d7-4471-be70-3169ce2aee47","resolution":{"observed_at":"2026-08-11T05:57:51.071097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-11T05:57:51.075050Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.075050Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:e3e69844ce87364e4708baf4d7bd08a3cb7439051b574c51fcce109bc318a566","observation_id":"46216a6d-52ce-417d-8b25-0848781b78bc","resolution":{"observed_at":"2026-08-11T05:57:51.075050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:57:51.366261Z","title":"Rényidivergenceand Kullback-Leibler divergence.IEEE Transactions on Infor- mation Theory, 60(7): 3797–3820","venue":null,"work_id":"22ed729a-aaf5-4c4e-9344-bc177a86b75d","year":2014},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.051171Z"},"links":{"citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:bef9341a252bf96a9cf57ea7bf8d9b826bc2cece72e691f34b12b2c0cb9efa52","observation_id":"49f09919-1614-428a-9f8e-00ce3e13d919","resolution":{"observed_at":"2026-08-11T05:57:51.372408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-08-18T16:13:56.407614Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-11T05:57:51.008080Z","title":"InProceedings of the 2016 conference on em- pirical methods in natural language processing,1317–1327","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.008080Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:67a11f862f57fd7578427bdab84ef9aa23951c9104b1ffe498deaa29eb7ee30d","observation_id":"abb5e02e-59b5-4365-9795-b310804e5112","resolution":{"observed_at":"2026-08-11T05:57:51.008080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:57:51.391303Z","title":"Gou,J.;Yu,B.;Maybank,S.J.;andTao,D.2021.Knowledge distillation: A survey.International journal of computer vision, 129(6): 1789–1819","venue":null,"work_id":"fce8ca24-c180-436a-b7fd-6ad2e8889fa2","year":2021},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:50.990619Z"},"links":{"citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:185b7dad9c01118aedca9fc2f248446f77eb5664543f3d454c6e9aae6ea4d10c","observation_id":"39e02caa-754d-4b65-9b75-46df2de1ce23","resolution":{"observed_at":"2026-08-11T05:57:51.395143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-17T10:54:45.389424Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-11T05:57:51.012718Z","title":"arXiv:2206.14858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.012718Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:af2a1b072a92c5abf5c3be7306d76909484078d57a3291e946389526b227dd33","observation_id":"49f2b6e4-87a6-4f3f-ad81-d79f9f09dca1","resolution":{"observed_at":"2026-08-11T05:57:51.012718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:57:51.402637Z","title":null,"venue":null,"work_id":"01ed5691-9f05-4178-82ec-265c1e32c556","year":2024},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:50.980488Z"},"links":{"citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:b2fa9c147146918652f70557f598aa8e3be090be206e0727fbd50333c1b01b94","observation_id":"8c4ed339-f714-4e9d-a641-632708282d8a","resolution":{"observed_at":"2026-08-11T05:57:51.406340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.03643","last_updated":"2016-02-26T02:21:52Z","snapshot_observed_at":"2026-08-17T20:00:39.118176Z","submitted_at":"2015-11-11T20:27:54Z","title":"Unifying distillation and privileged information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03643","snapshot_observed_at":"2026-08-11T05:57:51.025787Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:51.025787Z"},"links":{"cited_paper":"/paper/1511.03643","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:3da5dbc281776a0df23432fbc9ab16b1f2e47079e9b3737cb9ad2d9ee9e95a37","observation_id":"74884d22-95b9-49bc-936c-5d299c6fcb1e","resolution":{"observed_at":"2026-08-11T05:57:51.025787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-11T05:57:50.985760Z","title":"Garcia, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:50.985760Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.09826"},"observation_digest":"sha256:dd5d8034423a9981eba0e911f72bf8927e5574cd99f2fcb0ac7793a868e8686c","observation_id":"f082d908-3485-4b6e-bd7f-6227454726d8","resolution":{"observed_at":"2026-08-11T05:57:50.985760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09826","last_updated":"2026-08-10T16:43:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T17:39:46.492205Z","submitted_at":"2026-08-10T16:43:18Z","title":"Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2608.09826."}