{"as_of":"2026-08-10T13:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:277b6804be02b0d74b6f8fb70169a7719aac06760133d8421e2a6ef014128cf8","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T01:04:59.662046Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:05.711475Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T22:02:35.499158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":"2607.05184","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-04T22:02:35.499158Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","venue":"cs.AI","work_id":"2f6b90cc-5e59-4697-87dc-c78d3f7eedd5","year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-08T21:44:51.666551Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.791583Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:2b63fdb2e18acc2664114d3a1e7a24d4e2eb7630eb7e2aece3849e7364573145","observation_id":"713f8264-9954-41ac-9f95-00c226482406","resolution":{"observed_at":"2026-08-04T22:02:35.540632Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-06T16:39:05.711475Z","title":"arXiv preprint arXiv:2607.05184","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-10T02:49:16.716182Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.711475Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:19495cb3ad4c56d9bb8be9b823ccec262b4417b4567724b120308f933e09a0fc","observation_id":"de8a8bae-340f-406b-b2b5-d2ebd0a6a75e","resolution":{"observed_at":"2026-08-06T16:39:05.711475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05184/citation-record","integrity":"/paper/2607.05184/integrity","json":"/paper/2607.05184/citation-record.json","paper":"/paper/2607.05184"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07961","last_updated":"2024-12-10T22:57:57Z","snapshot_observed_at":"2026-08-06T12:44:07.837561Z","submitted_at":"2024-12-10T22:57:57Z","title":"Forking Paths in Neural Text Generation","version":1},"cited_work":{"arxiv_id":"2412.07961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.07961","snapshot_observed_at":"2026-07-08T01:14:27.523928Z","title":"Forking paths in neural text generation","venue":"cs.CL","work_id":"655acfb3-d569-4876-aa0f-2bb90c9ec628","year":2024},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2412.07961","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:b462477f333487302299dbbef77df8594f68dbed93aa368ebb9cf72e14cd3f98","observation_id":"cbba8739-0646-4fca-bb69-bfbedf14edfb","resolution":{"observed_at":"2026-07-08T01:14:27.525524Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:9f97ba17a183206cdce25c8dca9be4915920527b2423dc8a73e84d3b06faaf0e","observation_id":"396f6a89-249f-40bd-88a8-769fa5891127","resolution":{"observed_at":"2026-07-08T01:14:27.516491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.720637Z","title":"Chakravarthy, Anikait Singh, Nathan Lile, and Noah D","venue":null,"work_id":"0237bba7-4497-4fae-ba11-29e92b70065f","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:a8db081b099c786b97c259c8a98ee12278684c02af33682cdb2b8b9a3d8233f4","observation_id":"eb8f50b2-3593-4b2d-b1de-da1768b4882b","resolution":{"observed_at":"2026-07-08T01:14:27.721941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-07-12T21:38:13.191362Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":"2604.12002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-07-10T01:46:41.091851Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","venue":"cs.CL","work_id":"075fcc48-23c0-4231-bf6e-c629eb2a169b","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:faf42ac2614273b7cbd52d38e7d0a59917279ab915e347c1bd3cc3ed47ff482c","observation_id":"9146e4db-699d-489e-b982-0736d154a3fb","resolution":{"observed_at":"2026-07-08T01:14:27.515390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:7b58fcf47b2ac85ad2acbdd07bbff16696e40257463cfb7cfa44bb1a3961df71","observation_id":"f542e8fc-6641-4546-b5c8-3f025de3e865","resolution":{"observed_at":"2026-07-08T01:14:27.535875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":"2603.24472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-07-10T00:26:39.269322Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","venue":"cs.CL","work_id":"8df6a2d1-d890-48ae-af85-c11643a91097","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:472c134af31f750fc00fa211c4d7a75c13b509315e949bb8a23368e85ff04cd7","observation_id":"c3e91af8-c3b6-41ab-9971-e775278d404b","resolution":{"observed_at":"2026-07-08T01:14:27.528143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19943","last_updated":"2025-01-13T06:53:56Z","snapshot_observed_at":"2026-08-08T04:33:50.104780Z","submitted_at":"2024-11-29T18:58:22Z","title":"Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability","version":3},"cited_work":{"arxiv_id":"2411.19943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19943","snapshot_observed_at":"2026-07-08T01:14:27.537549Z","title":"arXiv preprint arXiv:2411.19943 , year =","venue":"cs.CL","work_id":"ba6fd699-ba05-4ff7-a077-bbcade21f6e4","year":2024},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2411.19943","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:6a4936d7cfeed5e5d94525ef73bf5bb2a41828d4ab08398c0b7cdf7a618e5fda","observation_id":"bdadb457-eb31-4c85-8b4e-19aedac412ad","resolution":{"observed_at":"2026-07-08T01:14:27.539267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18779","doi":"10.48550/arxiv.2601.18779","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pope: Learning to reason on hard problems via privileged on-policy exploration","venue":"arXiv (Cornell University)","work_id":"49d6a516-37ca-4bd7-8174-20b4b69db931","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:720c144640734a472b87279ee3eca794c59cf0a1079a5fcf95f3be2cb3309f87","observation_id":"e802dbe8-8581-4ab8-9b8b-9a0d04549f24","resolution":{"observed_at":"2026-07-08T01:14:27.537447Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:57.801171Z","title":"Reuse your flops: Scaling rl on hard problems by conditioning on very off-policy prefixes","venue":null,"work_id":"2be8a44f-c445-4fc6-9eec-82c26f802afc","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:f2069d268afc03ffe6b148d7c08f592a060eb31a22befd5f403130449212fd4b","observation_id":"36b68aad-dc12-4f62-80a3-5482845b9328","resolution":{"observed_at":"2026-07-08T01:14:27.529342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-10T13:12:49.377308Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:ee1838265cf9727d309d2fb1cbe51f9d078afa7b62ff8103562442561a142d08","observation_id":"be81aa2d-827e-4823-aac3-1f8519c3e5f3","resolution":{"observed_at":"2026-07-08T01:14:27.531170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":"2512.13961","doi":"10.1007/s13755-026-00428-z","metadata_source":"pith","pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Olmo 3","venue":"cs.CL","work_id":"74de5f5e-0a69-4f73-862d-e5705fa9f4bb","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:4cc0c3d043e3efc3a6d75bdf67849f882005442564b763c548cec02aea0209e6","observation_id":"1a4d5b85-22a0-4110-8d15-efd0c35c8128","resolution":{"observed_at":"2026-07-08T01:14:27.545307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.730840Z","title":"Understanding reasoning in thinking language models via steering vectors","venue":null,"work_id":"99a73a4f-a697-405b-9022-461bf0939ca3","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:5efeff02064e76de66bfe073ce05a23b4ef3fd38cfc13ba96b38d15911135545","observation_id":"afbf9a04-0dcf-4fd0-a8b4-6354c8bd52cf","resolution":{"observed_at":"2026-07-08T01:14:27.732244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:7fd5de10f0dbeaa78307f225e82b46d264c9577de34f024a092076506c05b4b4","observation_id":"9e148a67-9f7d-4410-9d2a-018a29fd6c7e","resolution":{"observed_at":"2026-07-08T01:14:27.542787Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01193","last_updated":"2026-06-24T22:44:36Z","snapshot_observed_at":"2026-08-02T16:28:38.685624Z","submitted_at":"2026-04-01T17:39:50Z","title":"Embarrassingly Simple Self-Distillation Improves Code Generation","version":2},"cited_work":{"arxiv_id":"2604.01193","doi":"10.48550/arxiv.2604.01193","metadata_source":"pith","pith_arxiv_id":"2604.01193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Embarrassingly simple self-distillation improves code generation","venue":"cs.CL","work_id":"c0ef109a-9f93-445a-beb2-16ed977cbebc","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2604.01193","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:350c1c51d651c835709f2bbb3676859e1a07b8bd6dcc757ced409936790b6c0c","observation_id":"c8272c1a-c400-4d83-9492-cf6d3c41167c","resolution":{"observed_at":"2026-07-08T01:14:27.525726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-10T11:34:20.766987Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:f54693310abf472a96f9bea3581a8f1e45392dbe27ef1d19c0b138626e16c3fd","observation_id":"a309d32f-8968-435e-b44c-7157562fe251","resolution":{"observed_at":"2026-07-08T01:14:27.501845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.729023Z","title":null,"venue":null,"work_id":"0976aac9-03e2-4d2f-893f-90e7e9613b0d","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:ec3163a94f9d05eeb2ff41eb7a4a0fc9edac8647a5ab3ec51824c39aa71c31cb","observation_id":"37258f2f-723a-488e-ad56-29a8a099477e","resolution":{"observed_at":"2026-07-08T01:14:27.730229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.718808Z","title":null,"venue":null,"work_id":"a1153dd0-1a42-4f9e-bf97-c39b704c4fc5","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:bd6bc0c08e30c1205037be057cfc2f222638ca0b51b2597266d7e4ad4245b65d","observation_id":"52c3f718-42b9-4900-b8bb-3706cb76ae18","resolution":{"observed_at":"2026-07-08T01:14:27.720002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.724590Z","title":"The Average column averages the three benchmarks","venue":null,"work_id":"63d6f377-2da1-4b86-884c-367d004a8871","year":2048},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:536b0ef0d21c8526db887ee4d6d1375b10975d1d5771386f24172ec706b9c787","observation_id":"dd3ad507-5f89-409f-b287-639a407cfec3","resolution":{"observed_at":"2026-07-08T01:14:27.726381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.722555Z","title":"Epistemic-token OPD applies the same loss only to tokens in the epistemic-marker set","venue":null,"work_id":"3b939d38-fc07-4807-a04e-84e80d0f76ce","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:5afbcae3f47037f89330457a86b1b32bd829803e6ff222492bbe082bd9a0f744","observation_id":"d7c7a81d-4e28-47fb-90ac-2186c707c26b","resolution":{"observed_at":"2026-07-08T01:14:27.723944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.733414Z","title":null,"venue":null,"work_id":"c0d3db60-1c82-46f0-914d-4550992a29a0","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:26080e1fbba0bbd3f36b79e551c5547fc0e75a5aadee4ee96e8fe49f4cadc555","observation_id":"cbf32b64-d01a-4caf-b5e1-191965f8354f","resolution":{"observed_at":"2026-07-08T01:14:27.734544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.727046Z","title":"Blue curves are base thinking models, orange curves are OPSD with full gold-demonstration context, and green curves are OPSD with final-answer-only privileged context","venue":null,"work_id":"aaf579ac-e070-46d9-8877-db3457ac9022","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:36827ecb57c460bd79ca1f1501bd5c7fff7f02a52147dfadd47aa173521b6470","observation_id":"dcfd014f-39a6-41f3-bcd6-0904ee2b91f3","resolution":{"observed_at":"2026-07-08T01:14:27.728454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":3,"verified_exact":7,"verified_fuzzy":5},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2607.05184."}