{"as_of":"2026-08-10T04:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f6859f685314a53efb01b4bbec92ecd4b41c4cf250434811180927f9f1fd475","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:45:28.754848Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03632/citation-record","integrity":"/paper/2608.03632/integrity","json":"/paper/2608.03632/citation-record.json","paper":"/paper/2608.03632"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T15:45:27.189748Z","title":"arXiv:2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.189748Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:2b91b139158b3497b18af801b1c205fcc384ed92bcaee97970c89d9a800d48e8","observation_id":"8b2a3a5d-08bf-4162-8138-f55bacf26117","resolution":{"observed_at":"2026-08-05T15:45:27.189748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07957","last_updated":"2025-04-27T07:20:02Z","snapshot_observed_at":"2026-08-07T16:06:45.226662Z","submitted_at":"2025-04-10T17:59:12Z","title":"MM-IFEngine: Towards Multimodal Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07957","snapshot_observed_at":"2026-08-05T15:45:27.304749Z","title":"arXiv:2504.07957","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.304749Z"},"links":{"cited_paper":"/paper/2504.07957","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:afe4250cdd4d08decfed6479b4c5d69c64f9d7c171eb1a00eaa04260b784dd72","observation_id":"910787fc-bc00-429a-aaf7-8146d37dff2f","resolution":{"observed_at":"2026-08-05T15:45:27.304749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-07-12T21:38:13.191362Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-08-05T15:45:27.675508Z","title":"arXiv:2604.12002","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.675508Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:d023e22c5d3db5439bb001b4aaca86e666a8db9b1d2f4e4aade2d529454efa8e","observation_id":"c610e6e4-90ca-48ff-ae8e-bba1f6b0a677","resolution":{"observed_at":"2026-08-05T15:45:27.675508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-05T15:45:27.876531Z","title":"arXiv:2504.11456","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.876531Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:6941ed024efcf205367a2c469718d76993339c4ce3b1e85a3428aad7d1e51338","observation_id":"b0728898-7d08-47bf-9a44-3da066a9ef98","resolution":{"observed_at":"2026-08-05T15:45:27.876531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-03T02:52:57.588273Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-08-05T15:45:28.014761Z","title":"arXiv:2605.03677","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.014761Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:03a0247ef3fd250fe195604eb277ac8a0935f4f39e9779e8e098974cd6568c41","observation_id":"8596dc5b-c604-4bed-8ed1-5741e6fea7c0","resolution":{"observed_at":"2026-08-05T15:45:28.014761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01577","last_updated":"2025-01-11T12:19:13Z","snapshot_observed_at":"2026-08-05T23:03:54.212188Z","submitted_at":"2024-09-03T03:23:00Z","title":"EvoChart: A Benchmark and a Self-Training Approach Towards Real-World Chart Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01577","snapshot_observed_at":"2026-08-05T15:45:28.054494Z","title":"arXiv:2409.01577","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.054494Z"},"links":{"cited_paper":"/paper/2409.01577","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:49dfb7b8741ec45d7b5d0040f2597a2a457c3924e9c78ae74f4be7ef7e35f8bb","observation_id":"40b6246b-549a-4d5e-b6d9-3971ff420825","resolution":{"observed_at":"2026-08-05T15:45:28.054494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-05T15:45:28.088167Z","title":"arXiv:2603.07079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.088167Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:be8732b456406fa736efd10e6e66c75d5f08d8b923f2642f53b7c968051622f3","observation_id":"a6227f7c-f675-458b-861e-bc7a0cd12455","resolution":{"observed_at":"2026-08-05T15:45:28.088167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T15:45:28.184751Z","title":"arXiv:2310.02255","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.184751Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:74321466d6c26c38bea28db65eb5eefc9032ef89bdaa2711d967dcfab6061671","observation_id":"512eb7c4-ccf2-44af-9c40-6f7b547500b7","resolution":{"observed_at":"2026-08-05T15:45:28.184751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-08-05T15:45:28.234751Z","title":"arXiv:2604.08527","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.234751Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:8d942d0eec13fcd4def4a5140c28fc070d132735fd0e2b67eec538c5da22502b","observation_id":"6c3e2508-4bdd-43ba-8437-be105f231caa","resolution":{"observed_at":"2026-08-05T15:45:28.234751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04917","last_updated":"2026-06-18T15:34:46Z","snapshot_observed_at":"2026-08-05T07:16:50.328179Z","submitted_at":"2026-04-06T17:56:25Z","title":"Vero: An Open RL Recipe for General Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04917","snapshot_observed_at":"2026-08-05T15:45:28.284751Z","title":"arXiv:2604.04917","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.284751Z"},"links":{"cited_paper":"/paper/2604.04917","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:111a7e74ba4d1301fa98b569d65408b4abed608193ed560edba3c5431a3fd120","observation_id":"b4e14d95-cf2f-443c-bebb-de6a1648d054","resolution":{"observed_at":"2026-08-05T15:45:28.284751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06585","last_updated":"2025-09-09T04:46:37Z","snapshot_observed_at":"2026-08-08T10:49:51.194546Z","submitted_at":"2025-08-08T04:23:04Z","title":"CountQA: How Well Do MLLMs Count in the Wild?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06585","snapshot_observed_at":"2026-08-05T15:45:28.335239Z","title":"Wang, H.; Wang, G.; Xiao, H.; Zhou, Y.; Pan, Y.; Wang, J.; Xu, K.; Wen, Y.; Ruan, X.; Chen, X.; and Qi, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.335239Z"},"links":{"cited_paper":"/paper/2508.06585","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:00aa2cf0dfb74730565bcca1571c88f10d33116ad02aa919abe9b33275a26168","observation_id":"f5af9c75-f3fb-4d67-82ce-f024a5b20b60","resolution":{"observed_at":"2026-08-05T15:45:28.335239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T15:45:28.384750Z","title":"arXiv:2506.01939","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.384750Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:3fe22d1e3f670d50b8ae824fdf92ce5e1c2aea5fed09e67636a0997c71ee610c","observation_id":"69ccea18-88af-4abf-abbe-4669e5bb28ed","resolution":{"observed_at":"2026-08-05T15:45:28.384750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-05T15:45:28.434843Z","title":"arXiv:2604.14084","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.434843Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:781f70924e6c3660402a0388f53e3f0923bfba701576caa9c9a6b24cf82f6412","observation_id":"d9393a8a-372b-478f-be15-25f15d60126d","resolution":{"observed_at":"2026-08-05T15:45:28.434843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T15:45:28.483499Z","title":"arXiv:2504.14945","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.483499Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:b9e577af528218629844c26a98f511d09ec7eecd7221519da274dda0a10f2414","observation_id":"1c304b16-3b54-43aa-a6d5-5aac31f10946","resolution":{"observed_at":"2026-08-05T15:45:28.483499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T15:45:28.509579Z","title":"arXiv:2505.09388","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.509579Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:dd6d6e3baf6772d6bf8e78e0da104c9cfcaa35c7a60bdec1a9a50248e216b1b9","observation_id":"9ddf68dd-24b8-454d-899b-a73fbedfbd1c","resolution":{"observed_at":"2026-08-05T15:45:28.509579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18740","snapshot_observed_at":"2026-08-05T15:45:28.554751Z","title":"arXiv:2605.18740","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.554751Z"},"links":{"cited_paper":"/paper/2605.18740","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:21eb36cbbd22e4221be5c85b67510d519c07cbbb208e21419c6ee7212fa5cd8d","observation_id":"f8b318d3-4929-411b-ab18-9844ee722836","resolution":{"observed_at":"2026-08-05T15:45:28.554751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-05T15:45:28.594751Z","title":"arXiv:2601.18734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.594751Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:7c95bbd1d40544484d058c45711d93011aa27a883aba3cd9144983499820617c","observation_id":"b814fdac-10ec-4c7c-84be-002e37a556fb","resolution":{"observed_at":"2026-08-05T15:45:28.594751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-02T07:46:19.307542Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-08-05T15:45:28.644839Z","title":"arXiv:2604.10688","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.644839Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:5d9dcb0ddff54fea8d5a64203a494483e28ceb8eb03ac19f60ad5cf1bad42431","observation_id":"e8a5b459-86f1-410d-aaf7-61bb5b9d33a6","resolution":{"observed_at":"2026-08-05T15:45:28.644839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.704748Z","title":"arXiv:2508.05612","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.704748Z"},"links":{"citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:e2b2374fdaa067fda345e6335e8daa7d083cb5c8594a7b64c6e1982f0a03fc39","observation_id":"afa86905-d01e-4bbc-bfba-53d6817e75e3","resolution":{"observed_at":"2026-08-05T15:45:28.704748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:32.592389Z","title":"Visual reasoning includes MathVision, Geo3K, and MathVistamini","venue":null,"work_id":"1323a21a-80be-48f9-acdc-8589a1d24cb8","year":2023},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.754848Z"},"links":{"citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:54edf18658ec1e3af3f8834ae8caff82716d15e5663e6ce50b111b937be2ebdd","observation_id":"78ae1c43-7b0b-4b79-8379-fe648a1b8c2c","resolution":{"observed_at":"2026-08-05T15:45:32.724835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T15:45:27.981139Z","title":"arXiv:2103.03874","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.981139Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:d204727bac544fc561fe651c6e7ce1ef77ff511ebbf843ab5a693a561c24a7c8","observation_id":"dadfcddc-b7d4-4ad8-880f-03dbbb04d5e4","resolution":{"observed_at":"2026-08-05T15:45:27.981139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-05T15:45:28.124748Z","title":"arXiv:2206.14858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.124748Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:f2db6ad21a6f655e4e1bd70634663642d7862765dd8b084bf96ea855fa634853","observation_id":"62507b1a-98bb-452b-bf33-54dc3613156e","resolution":{"observed_at":"2026-08-05T15:45:28.124748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-05T15:45:26.903610Z","title":"arXiv:2306.13649","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:26.903610Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:6462008fb28c0c23eabc16ada533eaf70f5cbab46c0b488422cffa4419a1b1a1","observation_id":"2a957429-309c-4739-9042-ddd817202f75","resolution":{"observed_at":"2026-08-05T15:45:26.903610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T15:45:27.054757Z","title":"arXiv:2505.22617","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.054757Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:8c21e1f544a4d5f68ee74d85db106664f1d2165b135e4a9ec678c928c2db629e","observation_id":"96f85aa7-cd70-482c-a65a-878bdf0f7f2c","resolution":{"observed_at":"2026-08-05T15:45:27.054757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-05T15:45:27.434932Z","title":"arXiv:2306.08543","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.434932Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:ab59f45c678e243ac2fc0a8b49ba44b2253bf18835b57a8371756b6f2a9baece","observation_id":"b451eb2e-28a0-4c81-9e52-f46697ee9180","resolution":{"observed_at":"2026-08-05T15:45:27.434932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T04:12:40.573796Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.03632."}