{"as_of":"2026-08-11T16:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0dcd325820afc8b8bda4f1969a203233e1b30485a6e3365935ca745748451f36","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:33:49.736376Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06802/citation-record","integrity":"/paper/2608.06802/integrity","json":"/paper/2608.06802/citation-record.json","paper":"/paper/2608.06802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.897576Z","title":null,"venue":null,"work_id":"956fa32e-a767-4cd3-ace2-6a3a9d34099f","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.283956Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:a925a721c53f16d0fe3f81faa346515ab8aac64a6e8e801564add0b2b536c393","observation_id":"ef144179-0aeb-497a-8b68-6a3cbf3a452c","resolution":{"observed_at":"2026-08-10T20:33:50.902438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.881106Z","title":null,"venue":null,"work_id":"e3808f5b-64f7-4237-9fd0-90515ebf0cd5","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.288917Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:fa98f1370f092adbd85fcee8db945990508c2d793801a6b0f824819390501ad0","observation_id":"b3a4a6ef-e9ba-43be-a079-e48ec06d953b","resolution":{"observed_at":"2026-08-10T20:33:50.885845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.864439Z","title":null,"venue":null,"work_id":"e15fdb40-8c31-42d7-b483-6ec26b81ef75","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.293292Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:0642b917067328604fbe754259888420198cf387bbce214fca8fe3a492b2430a","observation_id":"0a815c92-21ee-4acf-98f2-58340d06e92a","resolution":{"observed_at":"2026-08-10T20:33:50.869843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.303533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.303533Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:434920955304b7d2c63aed0edde04ac65afcb9f15c4f92b79bda760ed7cf42d0","observation_id":"65b44c54-7183-4b78-a184-64e58b48c85c","resolution":{"observed_at":"2026-08-10T20:33:49.303533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.308575Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.308575Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:251fa53dbfb0eb1fe99256bdee2f3054d955056ca8e9c9a2d8595ff5e68e6226","observation_id":"67242d56-717b-475b-96dc-048ef4a7c78c","resolution":{"observed_at":"2026-08-10T20:33:49.308575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.824567Z","title":null,"venue":null,"work_id":"fcb65158-542d-4251-9f31-f05579a20a79","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.325258Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:578f09dd44cff52e092b2431ff82d71aec89bb6b49c4d19ba1c984c749ade01e","observation_id":"91b6f477-29d1-4e9d-b6c5-09ad626b2d45","resolution":{"observed_at":"2026-08-10T20:33:50.830701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.339547Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.339547Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:49188dd0dade1b67014e902336759a18f5f5b1985ad047a54308ba8e02655843","observation_id":"857f75f7-5d95-4b61-ae2c-033a272dbfc0","resolution":{"observed_at":"2026-08-10T20:33:49.339547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.344333Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.344333Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:3f21e9588a7bc2a32b38f6c4ea73e34ab680044eda7612a0acbb27a1dfbfce9b","observation_id":"ff6f35e2-0386-4d0d-bc71-efff7f6188da","resolution":{"observed_at":"2026-08-10T20:33:49.344333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.785349Z","title":null,"venue":null,"work_id":"97ed23c2-6a6c-4fbf-9401-05bd077e4575","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.349341Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:05097a69b147aa7d26fa8164719e9d0606a4023b8e85b033364caa18937198ef","observation_id":"65e1b4b9-df83-4814-92d1-a86a36f8f57a","resolution":{"observed_at":"2026-08-10T20:33:50.790647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.378391Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.378391Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:46b99864e0c3b107223aff88500469de1428507fce7ed33cca55948b0da966a3","observation_id":"befecebd-cc7a-4c96-8e64-faf26c6091e1","resolution":{"observed_at":"2026-08-10T20:33:49.378391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.386825Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.386825Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c8337bbaa7eb757c36df98451bb8607dbc867d9b1ee799e907e5150f09fb56eb","observation_id":"ebefdfa2-3963-4a1e-83e7-399b922c7960","resolution":{"observed_at":"2026-08-10T20:33:49.386825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.756105Z","title":null,"venue":null,"work_id":"7f6b517a-cc45-4366-bc95-51e733bd432c","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.400294Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:96793929f03bb8bc8757b5b7161e8de9ef8b389b38786e3e43b745609db18267","observation_id":"0020694c-0aaa-44d5-b56e-1a5ad49aface","resolution":{"observed_at":"2026-08-10T20:33:50.760481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.740372Z","title":null,"venue":null,"work_id":"f47447c2-fed9-4a13-b377-d84738f03b1c","year":2025},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.404507Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:3e80bb656f7ff68dca1462ca5fb19ff15a2285897ca5846978b8b492aab4a72a","observation_id":"de12a7c6-9535-4c5c-8f62-5d45518e0f07","resolution":{"observed_at":"2026-08-10T20:33:50.745433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.413109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.413109Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:bfa77b9ae5c4987bec24b167e5f7c6e6c6e23928c56f99a5d71232ec7370895a","observation_id":"14923632-3ec7-4448-ab63-5b2032a4baa3","resolution":{"observed_at":"2026-08-10T20:33:49.413109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-10T20:33:49.417102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.417102Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:11641dc45cbb33e5a0a67f4098ab47f3f0c2f9404890a4d724d08a48a191f193","observation_id":"2512885d-a34c-4a01-967c-9394d53d1ddb","resolution":{"observed_at":"2026-08-10T20:33:49.417102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-10T20:33:49.421590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.421590Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c7f1e2b1baaf2173076967457d00fe872801f53c9835e2ab0f64ae5b1241a62b","observation_id":"135e7699-ef97-4eac-89af-1a285999b669","resolution":{"observed_at":"2026-08-10T20:33:49.421590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.709899Z","title":null,"venue":null,"work_id":"c78e7f2f-8ba8-4358-8122-0d6329339f97","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.480137Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:922581e2de65e1cdb134bdc9ca2586f29d2585bf20a997bd9083f69b5f79871a","observation_id":"4b21c2c7-3a2d-4746-91d9-e041ee20fcc7","resolution":{"observed_at":"2026-08-10T20:33:50.715339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.691428Z","title":null,"venue":null,"work_id":"00690e72-3ada-401c-9e66-e6bb4f0b103b","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.484333Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:ae76f10c8555c935c12146e05a4f10facab31cd9b2fc8eff509a41745af021d5","observation_id":"1985b918-d122-49ef-8455-8bed5d8fb505","resolution":{"observed_at":"2026-08-10T20:33:50.697789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.501958Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.501958Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:13331914bf78f242a7fd1b6df06c38309957d9ca05f04aeb0dc14dfdd5ec830f","observation_id":"e455a69e-0076-4f1a-bee0-6683cec08e28","resolution":{"observed_at":"2026-08-10T20:33:49.501958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.450","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.770797Z","title":"Mixture-of-Subspaces in Low-Rank Adaptation","venue":null,"work_id":"e772aeec-3f90-4f2c-a599-341a14d08e5e","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.506973Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:8c576331ea957b08ef5ff00b1c3d9b24b028a098b00780ce2d543032837480d5","observation_id":"016e2d75-2c33-4cd1-9b23-b166f1127ee3","resolution":{"observed_at":"2026-08-10T20:33:49.777643Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.511580Z","title":"Proceedings of the 2016 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.511580Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:d6ed014a1cc64c88e5ed48d840a444c4845d4ebc41fbd9f2aa37c0b2ce79d879","observation_id":"81d65f62-bb8f-4dda-b3f7-de26361485ab","resolution":{"observed_at":"2026-08-10T20:33:49.511580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.516946Z","title":"Proceedings of the 31st International Conference on Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.516946Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:acda00cb625c9a7c65315ed72703f05368d1d73189d0f228f5c64f0aea6b6d94","observation_id":"9d7e22cd-63b7-4977-b24d-c1971059e000","resolution":{"observed_at":"2026-08-10T20:33:49.516946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.643320Z","title":"Proceedings of ICLR , year=","venue":null,"work_id":"9f795a20-a241-4e3e-b65d-635a6bbd312c","year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.522220Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:7b46c037cc806451b1fead9a6ec8201a0b938813451194a4a2897c9026e0ae9d","observation_id":"dc13541b-6ebe-4956-b2aa-025976643320","resolution":{"observed_at":"2026-08-10T20:33:50.648240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.527152Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.527152Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:ecf96598e0d4cf5575ab327888077ba525b73b16eb3e27a3a863fc02d776633a","observation_id":"7436aaad-10cb-44cf-9aae-95d096e00430","resolution":{"observed_at":"2026-08-10T20:33:49.527152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-10T20:33:49.531991Z","title":"arXiv preprint arXiv:2602.12125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.531991Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:59997348817da248f0b56ba85bfc1cd5f9a29f92c8ab5e20d057d88336ad6063","observation_id":"23f39316-cb15-407a-9623-8087e98d0222","resolution":{"observed_at":"2026-08-10T20:33:49.531991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-10T20:33:49.537124Z","title":"arXiv preprint arXiv:2603.07079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.537124Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:75455ec5956ad77d32a6965ebf663feebed228e8e43f6828022039cab8a746d0","observation_id":"74f6452b-d4b2-4d73-b7ea-8468b7cd0a69","resolution":{"observed_at":"2026-08-10T20:33:49.537124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06387","last_updated":"2026-05-13T04:44:13Z","snapshot_observed_at":"2026-08-11T15:38:36.283287Z","submitted_at":"2026-05-07T15:02:49Z","title":"Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06387","snapshot_observed_at":"2026-08-10T20:33:49.542550Z","title":"arXiv preprint arXiv:2605.06387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.542550Z"},"links":{"cited_paper":"/paper/2605.06387","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:646f9afdfab39c3db6f9613a133b8343588f5c6f9f1c3ea713c7d8b0a030d1ec","observation_id":"14ee432b-3311-43b0-9de8-1496e42477d2","resolution":{"observed_at":"2026-08-10T20:33:49.542550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.613163Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"48a56ecc-92b3-4a8d-9620-b47c4566ea2c","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.548093Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c10e48e99f35230ee111e04aaecd7daf4cec69b6bc65fa8da2b7d0f656686803","observation_id":"1c07e88a-f9e5-4b71-b56a-db6b26ca0c15","resolution":{"observed_at":"2026-08-10T20:33:50.619081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07804","last_updated":"2026-06-01T07:36:57Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T14:38:53Z","title":"Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07804","snapshot_observed_at":"2026-08-10T20:33:49.552957Z","title":"arXiv preprint arXiv:2605.07804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.552957Z"},"links":{"cited_paper":"/paper/2605.07804","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c776977403f23da6ee13e3fff097e067fdbb057a599c3115d5a91b97ef74cb8c","observation_id":"e1cba832-d5fe-4e4a-b2bb-931f5e5e8df7","resolution":{"observed_at":"2026-08-10T20:33:49.552957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07865","snapshot_observed_at":"2026-08-10T20:33:49.557968Z","title":"arXiv preprint arXiv:2605.07865 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.557968Z"},"links":{"cited_paper":"/paper/2605.07865","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b0ad69656490c980ef5ead0da4d9e4b99373982164c2262642908fd6f008cead","observation_id":"9d44ea29-b433-4735-91c0-a3250287ac37","resolution":{"observed_at":"2026-08-10T20:33:49.557968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-08-10T20:33:49.562624Z","title":"arXiv preprint arXiv:2604.08527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.562624Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:2dac8b72b139b6afffd0f7448dd114fbe829ddfa57db496175822b8596cfa200","observation_id":"7d20e4bc-5b7a-493d-8afd-1169e5382376","resolution":{"observed_at":"2026-08-10T20:33:49.562624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-11T02:54:03.247102Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-10T20:33:49.566675Z","title":"arXiv preprint arXiv:2603.25562 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.566675Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:489968b5028460b6d28661380fedb4a82b1454bfd6909534ec07100597a90728","observation_id":"be1f3aea-cb85-4338-99fd-1eb62b584fd7","resolution":{"observed_at":"2026-08-10T20:33:49.566675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-10T20:33:49.570616Z","title":"arXiv preprint arXiv:2604.13016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.570616Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:27b57cb71c2266b1ecf6eccfb1e11d120fde75b47bbe4d515bf1f218496084d7","observation_id":"0fe7d395-616c-421f-ade7-2084ad8521c9","resolution":{"observed_at":"2026-08-10T20:33:49.570616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T20:33:49.574650Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.574650Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:49c18655aa666d128ddc0eea0e2c83aba6ee469f713a0e133ec2a7695cc3e05b","observation_id":"3d6cbaa1-dd27-460e-adae-4b852a346f6e","resolution":{"observed_at":"2026-08-10T20:33:49.574650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-10T20:33:49.578815Z","title":"arXiv preprint arXiv:2604.13010 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.578815Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:91f97d93bab9021994d5860d80dea9ca92ff1d4acecdf10b008d6b87b9eeaed7","observation_id":"0368f9e2-4e8a-4a57-a457-3a9184e77478","resolution":{"observed_at":"2026-08-10T20:33:49.578815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12483","last_updated":"2026-05-20T14:15:58Z","snapshot_observed_at":"2026-08-11T14:42:54.259282Z","submitted_at":"2026-05-12T17:57:48Z","title":"Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12483","snapshot_observed_at":"2026-08-10T20:33:49.583587Z","title":"arXiv preprint arXiv:2605.12483 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.583587Z"},"links":{"cited_paper":"/paper/2605.12483","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:5d53a437308ff39ce6b34deb08b7d31bb2d85b27a401f4e5d82bedb5862b9544","observation_id":"501f21e1-f11d-4b09-a796-907dc7d41e52","resolution":{"observed_at":"2026-08-10T20:33:49.583587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31159","last_updated":"2026-05-29T11:06:06Z","snapshot_observed_at":"2026-08-09T14:32:57.358635Z","submitted_at":"2026-05-29T11:06:06Z","title":"Trust-Region Behavior Blending for On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31159","snapshot_observed_at":"2026-08-10T20:33:49.587672Z","title":"arXiv preprint arXiv:2605.31159 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.587672Z"},"links":{"cited_paper":"/paper/2605.31159","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:289c322cc9f7f411bb5b21c1a64d27dc3d3acb74669e39250ceea6ee9a716dec","observation_id":"5f5ef6b4-ef4e-4b76-9076-b6c0d4f1cec9","resolution":{"observed_at":"2026-08-10T20:33:49.587672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09304","last_updated":"2026-06-08T10:11:58Z","snapshot_observed_at":"2026-08-01T14:37:58.992350Z","submitted_at":"2026-06-08T10:11:58Z","title":"SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09304","snapshot_observed_at":"2026-08-10T20:33:49.591651Z","title":"arXiv preprint arXiv:2606.09304 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.591651Z"},"links":{"cited_paper":"/paper/2606.09304","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:7631e880b4c3c9e85e8cf276a645f9a13621b2c7459df7195277086340dbb259","observation_id":"43b83b9f-942c-4b4b-b1a9-a1df1bba845f","resolution":{"observed_at":"2026-08-10T20:33:49.591651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.596099Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.596099Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:056d3c83740ae5392558703f522df73118dfff1e9c4038ec99475ae1645a9402","observation_id":"c6fedba5-4b7a-4fce-a823-47355892ff7b","resolution":{"observed_at":"2026-08-10T20:33:49.596099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.600676Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.600676Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:cb6cfa0def4d2f2f79c18ccc18a29f544773b1d660984c164f4a17d846e8e0b4","observation_id":"7c663cbe-dd47-4c61-896e-cb4d4cb831ac","resolution":{"observed_at":"2026-08-10T20:33:49.600676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.606635Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.606635Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:07068d3d81468561da57feee40fc6756b731eef0fc2ec692c330f69999fe015b","observation_id":"9d5a3855-541c-469a-8940-39754b690b1c","resolution":{"observed_at":"2026-08-10T20:33:49.606635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.612004Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.612004Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:267b8505419671ffb4a111b810a12bed8a6f1c2f01f86e05f5c9803aa84492d4","observation_id":"4aadfd65-3c26-42a6-9fad-c8a10958991f","resolution":{"observed_at":"2026-08-10T20:33:49.612004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.558464Z","title":"2024 , howpublished =","venue":null,"work_id":"44d0db99-0e81-499d-aa75-e4516b29b14a","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.618269Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:6029fe95875c38c28001f9af5fbc88ce1ded25f164e4959f6916bbeb1c7159f5","observation_id":"5c06ccd7-c1ca-4234-9561-3782dd61db10","resolution":{"observed_at":"2026-08-10T20:33:50.563399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.543276Z","title":"2025 , howpublished =","venue":null,"work_id":"618a6196-57a1-40a7-8e07-17a713eb5605","year":2025},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.624253Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:5765a353f85e693918eaca5669d40e50d8ac95efb4b5ed775d29864b2b9fb580","observation_id":"7f0d3155-6106-4d83-9ce5-0923beb9459a","resolution":{"observed_at":"2026-08-10T20:33:50.547764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-10T20:33:49.630253Z","title":"arXiv preprint arXiv:2311.07911 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.630253Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:a6102a8a77f8dd0783b44c1e5fdb21bcc2d95e72f91c20ae44173d9be0747091","observation_id":"6865d6ec-680b-4ce0-9331-5383e2412a12","resolution":{"observed_at":"2026-08-10T20:33:49.630253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.635158Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.635158Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:d3b4b0f791664f41cfa8757b9e7075a66f15a0219f610f340537e0dfc8cd1813","observation_id":"ad7fc911-4566-4447-a900-f7d322d916c5","resolution":{"observed_at":"2026-08-10T20:33:49.635158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T20:33:49.641018Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.641018Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:7cdc0d275c34a3270a1ea2a868701ea62f1b353fad89eced0c2292f6851bda54","observation_id":"39f646b4-25bb-4ee1-8c9a-81637d313b08","resolution":{"observed_at":"2026-08-10T20:33:49.641018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-10T20:33:49.646014Z","title":"arXiv preprint arXiv:2406.01574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.646014Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:27ac8eaef38efb06a13d78ef75c0209f4e661e6e588a192bb03068de1d1699e4","observation_id":"64427f07-89a1-4baf-ae3d-3544708b9cfb","resolution":{"observed_at":"2026-08-10T20:33:49.646014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.650598Z","title":"Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.650598Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:120fd0c375c0d09dc1abfde117b7fc2c14df1e5120c1a0c83eaf6c128ac4bbc8","observation_id":"d219aade-8db3-4065-96d0-199091e0796c","resolution":{"observed_at":"2026-08-10T20:33:49.650598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.655139Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.655139Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b7ff56178f4c37e553964fc86b1d94c2b2530b5f390d067ba8ef9187cdceeda9","observation_id":"d8484ec6-4547-44b7-bb6b-f927e81376f8","resolution":{"observed_at":"2026-08-10T20:33:49.655139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.660971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.660971Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:ac1de789460014c5b27e971eeb0ce96570e8bd4de688d950d6665fc346a209a8","observation_id":"fdfb6822-0837-42a9-9fc0-8ccce4209f75","resolution":{"observed_at":"2026-08-10T20:33:49.660971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27028","last_updated":"2026-05-26T13:49:37Z","snapshot_observed_at":"2026-08-11T15:52:54.607917Z","submitted_at":"2026-05-26T13:49:37Z","title":"Less is More: Early Stopping Rollout for On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27028","snapshot_observed_at":"2026-08-10T20:33:49.666475Z","title":"arXiv preprint arXiv:2605.27028 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.666475Z"},"links":{"cited_paper":"/paper/2605.27028","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:bccd91edf80db62350f37dffcea8f8c5ed1bc700c64c4d345ac8796091e4e962","observation_id":"2021a775-a527-44b1-bbb2-aee716cf6052","resolution":{"observed_at":"2026-08-10T20:33:49.666475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.671727Z","title":"arXiv preprint arXiv:2603.11137 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.671727Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:cae05312d051d2491fcc01bc4d939623bde100338ae5850aa97ebcc47765c35b","observation_id":"da8ca90e-a62b-4441-9ab1-262792531410","resolution":{"observed_at":"2026-08-10T20:33:49.671727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.481163Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"7a956ca0-8c31-46b8-b459-7de1d075006a","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.676533Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c2cda04d2bb40ef48f12d96ed5297c29afb4cf3f9f19147f306dbcd2129fc08f","observation_id":"fabb859e-5aab-4f91-8cae-bfffed6b9535","resolution":{"observed_at":"2026-08-10T20:33:50.486209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-08-10T20:33:49.681299Z","title":"arXiv preprint arXiv:2603.24472 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.681299Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:8800d7b5f4d289782edbb4c80a65d647e2fd39fab2356c10a1b3c98b8393165c","observation_id":"0b42afa9-e6c7-4f0d-9ee7-a5cc12a730c9","resolution":{"observed_at":"2026-08-10T20:33:49.681299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":"2607.05394","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-08-10T20:33:50.428991Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","venue":"cs.LG","work_id":"50f33129-8ca9-4d0f-86a1-affd5d374c86","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.685457Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:f70ea098e2f6ad996ce65a958dc9a9a96304d54968f82cbf37917374aaf4640f","observation_id":"f538fc11-6f86-48e9-819b-19603f675c50","resolution":{"observed_at":"2026-08-10T20:33:50.434056Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-09T21:27:50.184610Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-10T20:33:49.690977Z","title":"arXiv preprint arXiv:2607.05184 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.690977Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:31cfbd608a8d84f0949d24ba49b1310241dba50bdd24397b158b7c2d0c0db7ce","observation_id":"75ab8712-8de3-4b5a-b064-92fb51e46615","resolution":{"observed_at":"2026-08-10T20:33:49.690977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.695432Z","title":"Thinking Machines Lab: Connectionism , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.695432Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:36291d85cac5d16d31e6c61d8d6ec20aa84b16ff9f1872c4f69d8d2d0a239353","observation_id":"739fbd00-3c00-43b7-bdb2-0d14caab0d34","resolution":{"observed_at":"2026-08-10T20:33:49.695432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T20:33:49.701085Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.701085Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:36387359144b11a98e42fae24cd2927f58b2e1896df068b536d12a7d478ae6a2","observation_id":"a4ab0f6a-96ed-46d1-afe8-a5afef35d747","resolution":{"observed_at":"2026-08-10T20:33:49.701085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17199","last_updated":"2026-06-15T18:37:51Z","snapshot_observed_at":"2026-08-08T14:44:03.594424Z","submitted_at":"2026-06-15T18:37:51Z","title":"PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation","version":1},"cited_work":{"arxiv_id":"2606.17199","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.17199","snapshot_observed_at":"2026-08-10T20:33:49.850337Z","title":"PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation","venue":"cs.LG","work_id":"cd010048-eaaa-45b4-bc16-6309bebbc432","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.708228Z"},"links":{"cited_paper":"/paper/2606.17199","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:6862a2534cf6f67c66b96237f99a0a0fa4f4359cd40cbc33100cadaa10d6878c","observation_id":"c80fcf15-757e-4593-ba35-37f0e5ade828","resolution":{"observed_at":"2026-08-10T20:33:49.856399Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.715209Z","title":"arXiv preprint arXiv:2512.16649 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.715209Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:ac74beea2b97e0f0fc26fe6b097ac5079b07cc18e8cfc06b9ecde42d3962fa4c","observation_id":"161c7e63-b872-459d-a1a3-b9429805685b","resolution":{"observed_at":"2026-08-10T20:33:49.715209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00755","last_updated":"2026-05-30T14:44:57Z","snapshot_observed_at":"2026-08-05T06:50:53.081239Z","submitted_at":"2026-05-30T14:44:57Z","title":"Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.00755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.00755","snapshot_observed_at":"2026-08-10T20:33:49.897555Z","title":"Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning","venue":"cs.CL","work_id":"88966fde-6f7e-44e2-a474-a077b563002f","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.720560Z"},"links":{"cited_paper":"/paper/2606.00755","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:59e2de168afbd73d7f630b9adf2a82343e52d3207475a61758043c89c9eb48dd","observation_id":"fd50169e-ef4b-436b-9085-a55b9db48cc4","resolution":{"observed_at":"2026-08-10T20:33:49.902967Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-10T20:33:49.725936Z","title":"arXiv preprint arXiv:2601.02780 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.725936Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:57f8ddbdb2360344ea5292611b256844a60160c11daa42af152352117505b4a2","observation_id":"c4b0e66e-fe26-4e82-a532-d6684d3a8dcc","resolution":{"observed_at":"2026-08-10T20:33:49.725936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.731715Z","title":"arXiv preprint arXiv:2606.19348 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.731715Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:974a2ea0017e6e2b8c480ebda7aca5496ebb9754ce2fc769cb58d9da723b74b9","observation_id":"29dd08fa-36a2-40c5-94c7-2e26e0371814","resolution":{"observed_at":"2026-08-10T20:33:49.731715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.736376Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.736376Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b45b54c26691267de9148f5eec73ab33593a948864ce56017bc41c581816e300","observation_id":"676baaa3-9a14-4f78-98ec-50d064568d12","resolution":{"observed_at":"2026-08-10T20:33:49.736376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T15:11:38.696005Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":56,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2608.06802."}