{"as_of":"2026-08-19T01:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09de5d676c2db74d37ea551bc5a99640e1d85591ab068b2485f8b2210bf14a64","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:06:37.146320Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29078/citation-record","integrity":"/paper/2607.29078/integrity","json":"/paper/2607.29078/citation-record.json","paper":"/paper/2607.29078"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.072991Z","title":"ReAct: Synergizing reasoning and acting in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.072991Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:2321622f59b16e42b1ad0860396d6d4e8b0361f21659c9901542f102e8b959fd","observation_id":"c0dd18c9-a40d-4b48-9eda-b3c9ad267c3b","resolution":{"observed_at":"2026-08-03T14:06:37.072991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.077093Z","title":"ScienceWorld: Is your agent smarter than a 5th grader?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.077093Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:cb001e6066c0995eb005fd4fdb61d14684268d3a303f379e00548279c1c69f15","observation_id":"b283051f-0900-4432-8ac3-ec4cd498b4c4","resolution":{"observed_at":"2026-08-03T14:06:37.077093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.080207Z","title":"WebShop: Towards scalable real-world web interaction with grounded language agents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.080207Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:4b8a00ebc702d944c322a9e94ff94a46248f59fb5362bb0e870279c9c0e1bbfe","observation_id":"f6b7f3d9-595d-41b5-9435-84cd6ab76bb0","resolution":{"observed_at":"2026-08-03T14:06:37.080207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.083270Z","title":"FrugalGPT: How to use large language models while reducing cost and improving performance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.083270Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:2ada5baf4adc98413164e4829cea45519649779e8cdda844adff2c806b3d2b43","observation_id":"c7957476-63b8-48d5-96d0-fbcb7b36c7d3","resolution":{"observed_at":"2026-08-03T14:06:37.083270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-03T14:06:37.086500Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.086500Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:4643ef405a9b1dff961e4e6e0df546016b74c6bd1f12afc62ff37549cefe9b83","observation_id":"9a934812-140b-4f8e-8389-bc5c41d32f4e","resolution":{"observed_at":"2026-08-03T14:06:37.086500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.090133Z","title":"Sequence-level knowledge distillation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.090133Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:a8de0025961bba8bf3a17d6c491cc4cdfdc4a02115c3aac755ebb3dc49cafd5e","observation_id":"a7ad1d76-a793-405a-a223-0cc983469981","resolution":{"observed_at":"2026-08-03T14:06:37.090133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.093224Z","title":"MiniLLM: Knowledge distillation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.093224Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:ea8947de34b663da71c854913317e241b86c8a1343004f2cbb00fccef8e51c14","observation_id":"28a95aed-37e6-47bd-a80b-6607e28bf713","resolution":{"observed_at":"2026-08-03T14:06:37.093224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.095971Z","title":"On-policy distillation of language models: Learning from self-generated mistakes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.095971Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:ce0f5c2567a0bc3f8aa82033e93145b5a32c5ac33e9d8e49eac48e923c82aa0d","observation_id":"8d5968c9-eace-4b63-92f8-af6d37d17293","resolution":{"observed_at":"2026-08-03T14:06:37.095971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.104684Z","title":"On-policy distillation with curriculum turn-level guidance for multi-turn agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.104684Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:70c32dc7cb56affab8f3bbdcde3188795ef19ebfb7831258fbcd497c08fba8b2","observation_id":"a8a3ad13-26dd-4f2f-b4de-d371f204aa2a","resolution":{"observed_at":"2026-08-03T14:06:37.104684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.107862Z","title":"ThriftyDAgger: Budget-aware novelty and risk gating for interactive imitation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.107862Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:9d8257e63f2c19657ad06ee6d2397a8b378adc148e9b76560326de514cf059a6","observation_id":"6facf001-7b47-4431-9ae4-fcd8b922653f","resolution":{"observed_at":"2026-08-03T14:06:37.107862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.111022Z","title":"Robot-gated interactive imitation learning with adaptive intervention mechanism,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.111022Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:d6b443caccbb2fb57f94c8b5a1a29451c56be233f9858f07cd765249f68c76f7","observation_id":"2270f170-fff2-4836-8d25-63b78b8d1805","resolution":{"observed_at":"2026-08-03T14:06:37.111022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-13T15:27:25.430393Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-03T14:06:37.113774Z","title":"ALFWorld: Aligning text and embodied environments for interactive learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.113774Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:88e02b0f4244361550128924fa09a7a7774541c4684e46d1bedaa1195fc3bffd","observation_id":"79757423-e27d-4be7-b58a-085df8f9fd38","resolution":{"observed_at":"2026-08-03T14:06:37.113774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.116894Z","title":"Curriculum learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.116894Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:7b4fffa493312f286c9efced08234a558e9f27f3999facaede2bbba3ea55a60b","observation_id":"b92a4689-4b81-465a-a67f-1ab914e64891","resolution":{"observed_at":"2026-08-03T14:06:37.116894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05804","last_updated":"2026-07-07T03:56:35Z","snapshot_observed_at":"2026-08-16T13:49:03.913563Z","submitted_at":"2026-07-07T03:56:35Z","title":"TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05804","snapshot_observed_at":"2026-08-03T14:06:37.119843Z","title":"TurnOPD: Making on-policy distillation turn-aware for efficient long-horizon agent training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.119843Z"},"links":{"cited_paper":"/paper/2607.05804","citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:e0ee6482304278ad6196a89a97e45a0865fac41d1f50d8d2a95182d843f8ec0b","observation_id":"f435452f-5f08-4d59-89e1-438ff68ecae6","resolution":{"observed_at":"2026-08-03T14:06:37.119843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.122839Z","title":"SWITCH: Studying with teacher for knowledge distillation of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.122839Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:1c1438762d7b4eaf94d78b9557fcb0cb4ccc0339ff77f76210ec89e4c6267227","observation_id":"d09cabfe-e9fb-48cd-8571-912c7dc290c8","resolution":{"observed_at":"2026-08-03T14:06:37.122839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.125749Z","title":"AdaSwitch: Balancing exploration and guidance in knowledge distillation via adaptive switching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.125749Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:48708e97e2af0cc585bf854cef1ae4fe9c67f32b257fc5cfb5076271427a738d","observation_id":"c3f18fd3-5465-4a44-aea0-d4c1e6a816ce","resolution":{"observed_at":"2026-08-03T14:06:37.125749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31490","last_updated":"2026-05-29T16:12:54Z","snapshot_observed_at":"2026-08-13T02:30:39.456000Z","submitted_at":"2026-05-29T16:12:54Z","title":"Are Full Rollouts Necessary for On-Policy Distillation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31490","snapshot_observed_at":"2026-08-03T14:06:37.128585Z","title":"Are full rollouts necessary for on-policy distillation?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.128585Z"},"links":{"cited_paper":"/paper/2605.31490","citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:4f214f742c390d036005d75c1a51b3f451bd1ee1f050b39aa4ad812247f53886","observation_id":"f9e05e5f-7da8-45ef-ac01-2995790af469","resolution":{"observed_at":"2026-08-03T14:06:37.128585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27028","last_updated":"2026-05-26T13:49:37Z","snapshot_observed_at":"2026-08-14T11:18:55.996756Z","submitted_at":"2026-05-26T13:49:37Z","title":"Less is More: Early Stopping Rollout for On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27028","snapshot_observed_at":"2026-08-03T14:06:37.131756Z","title":"Less is more: Early stopping rollout for on-policy distillation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.131756Z"},"links":{"cited_paper":"/paper/2605.27028","citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:2098fe336bb69411e9d5e7a010b2898c7b2da6a1e43576b90923456122b34d4c","observation_id":"d86e0c91-f9ca-4d38-aecb-a5477e13d40b","resolution":{"observed_at":"2026-08-03T14:06:37.131756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.135038Z","title":"AgentBench: Evaluating LLMs as agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.135038Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:64ad147162329e8c0ef95b976b102ad5e1ed6ab3e65ca04adc37e4433b4ba4b2","observation_id":"5f677208-344e-482c-8014-11a84f809589","resolution":{"observed_at":"2026-08-03T14:06:37.135038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.137921Z","title":"On information and sufficiency,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.137921Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:3ad5905e0a65991f051955dd18a783fd6911f2388e48889441b58370ade9de80","observation_id":"a369ab67-1ba5-49ef-853c-fa63e4937c11","resolution":{"observed_at":"2026-08-03T14:06:37.137921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.140662Z","title":"Note on a method for calculating corrected sums of squares and products,","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.140662Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:7b1b697e8a12f58e57afe94f4ab73b5892cac9abf2d55df95df1f20edfe0f209","observation_id":"9d23c1fc-d75a-481c-8304-05df60a88207","resolution":{"observed_at":"2026-08-03T14:06:37.140662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:06:37.143483Z","title":"Continuous inspection schemes,","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.143483Z"},"links":{"citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:75bedf63c68cca7d2b5f6260e7dd7e892ed4abeae258ae26c90a4f92759ef98a","observation_id":"a42577ba-52fa-4cb8-bfc5-9a25a5642798","resolution":{"observed_at":"2026-08-03T14:06:37.143483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T14:06:37.146320Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.146320Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:900a76068eb107d86373859036760137771fa842945e65cc19aecbdc70ade9a2","observation_id":"a861d979-b6df-400d-bdf4-7323a31c9cd4","resolution":{"observed_at":"2026-08-03T14:06:37.146320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-08-13T09:07:17.541162Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-08-03T14:06:37.101854Z","title":"Available: https://arxiv.org/abs/2604.24005","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T14:06:37.101854Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2607.29078"},"observation_digest":"sha256:0c321a28475933580cc83daf230a9133f70ed3543069a6ab1b3cf1c293429528","observation_id":"93e6c370-95e3-40c4-8e9c-f84cf67c79bc","resolution":{"observed_at":"2026-08-03T14:06:37.101854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29078","last_updated":"2026-07-31T06:57:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T02:31:18.897358Z","submitted_at":"2026-07-31T06:57:17Z","title":"DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.29078."}