{"as_of":"2026-08-16T15:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:854a97a80036622172233955eb609aa030f1b579dfd51195724bb4d08f3d6f45","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:39:46.192328Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10905/citation-record","integrity":"/paper/2608.10905/integrity","json":"/paper/2608.10905/citation-record.json","paper":"/paper/2608.10905"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T14:39:45.970787Z","title":"arXiv preprint arXiv:1503.02531 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:45.970787Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:e86a833aa3dc3ad42b192504582152500b0a22beb52e5c4021c6438659e89d6d","observation_id":"685a7342-bfbb-4716-8197-873ea6cda576","resolution":{"observed_at":"2026-08-12T14:39:45.970787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:45.978976Z","title":"Proceedings of the fourteenth international conference on artificial intelligence and statistics , pages=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:45.978976Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:03fd87b36f67ce007001a05a2a7d7c69c0788a377e7b02b1cfaf98e394582f95","observation_id":"e83eae59-33f4-419f-9d76-53d6a07b7b39","resolution":{"observed_at":"2026-08-12T14:39:45.978976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:45.984446Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:45.984446Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:f1a664096d770ac13fef46452e3244d8d374bf2c861827bbc6f73b6b53a45365","observation_id":"867cd931-9f82-43f0-a176-5008868af277","resolution":{"observed_at":"2026-08-12T14:39:45.984446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:45.989912Z","title":"Proceedings of the 2016 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:45.989912Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:2a092ac6a4d88868792f393061b7dcf5525c5cb67701a48d08f5fc40360eed81","observation_id":"92375556-d319-4df2-b9fb-584d2af70cec","resolution":{"observed_at":"2026-08-12T14:39:45.989912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:45.996209Z","title":"The twelfth international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:45.996209Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:b2139c09c516f35ccd3ea9b63d7ca401163631a9a163c4022881a2e9eb32ec43","observation_id":"8af03f3b-3b10-4c6c-b371-b4c808bb6adc","resolution":{"observed_at":"2026-08-12T14:39:45.996209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.002724Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.002724Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:0e42ecabbeef56ad37137eaa433cac893fcf0c8f1dea840f0cae7fba204459b6","observation_id":"8076c3c9-d8c2-47d7-aa7c-d6b3cae24d5b","resolution":{"observed_at":"2026-08-12T14:39:46.002724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28562","last_updated":"2026-06-26T19:41:02Z","snapshot_observed_at":"2026-07-07T00:02:38.226622Z","submitted_at":"2026-06-26T19:41:02Z","title":"SEAD: Competence-Aware On-Policy Distillation via Entropy-Guided Supervision","version":1},"cited_work":{"arxiv_id":"2606.28562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.28562","snapshot_observed_at":"2026-08-12T14:39:46.859991Z","title":"SEAD: Competence-Aware On-Policy Distillation via Entropy-Guided Supervision","venue":"cs.CL","work_id":"84188057-32be-4a57-9d73-f9ffc50bb31f","year":2026},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.008534Z"},"links":{"cited_paper":"/paper/2606.28562","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:572c2b4da8614aefd5c5fac11abae69ccacfdb5a730c5839ad80f39d03acbfed","observation_id":"1bacbc2e-a671-4cf6-9208-4d889c6e5bce","resolution":{"observed_at":"2026-08-12T14:39:46.865832Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-13T20:57:43.825707Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-12T14:39:46.014468Z","title":"arXiv preprint arXiv:2607.02770 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.014468Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:af63a9d4b18fc99ada544df35a9820c22b437a122cc5675ece5e9e7989db5fdb","observation_id":"f32591c1-6089-486e-9eb4-e7744065ac60","resolution":{"observed_at":"2026-08-12T14:39:46.014468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-12T14:39:46.021216Z","title":"arXiv preprint arXiv:2604.13016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.021216Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:4dc9f9583a94f0ea85141d5c974a9e37108558d76502d762a1da66f2a421475b","observation_id":"f23ccda5-950a-46a2-a2d0-8e92b4a15386","resolution":{"observed_at":"2026-08-12T14:39:46.021216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-12T14:39:46.026679Z","title":"arXiv preprint arXiv:2603.25562 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.026679Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:af64ec11c8eda02b8c23292d51e4903b30726035077170eefd9a7b458d194f3e","observation_id":"31d0bce3-c682-4eaa-8816-0d6c13a46d4a","resolution":{"observed_at":"2026-08-12T14:39:46.026679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-14T23:07:50.063910Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-08-12T14:39:46.032885Z","title":"arXiv preprint arXiv:2605.07725 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.032885Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:91b195296dbbbd7c6136e7bce2a296a40897187b3c63b5f18b08633e3943569c","observation_id":"c6bafc8a-999b-45d9-8ef7-98c85aea6af1","resolution":{"observed_at":"2026-08-12T14:39:46.032885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02684","last_updated":"2026-06-04T15:52:50Z","snapshot_observed_at":"2026-08-05T23:43:40.149646Z","submitted_at":"2026-06-01T17:58:22Z","title":"Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02684","snapshot_observed_at":"2026-08-12T14:39:46.038526Z","title":"arXiv preprint arXiv:2606.02684 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.038526Z"},"links":{"cited_paper":"/paper/2606.02684","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:17a5867fd7258b6b899fb2b9b268e41fee17a8e8d15f3a6d789f9d557f4ac20b","observation_id":"62d6cb8d-2b94-4beb-8412-05bd420dacd0","resolution":{"observed_at":"2026-08-12T14:39:46.038526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07804","last_updated":"2026-06-01T07:36:57Z","snapshot_observed_at":"2026-08-15T03:10:22.466759Z","submitted_at":"2026-05-08T14:38:53Z","title":"Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07804","snapshot_observed_at":"2026-08-12T14:39:46.043821Z","title":"arXiv preprint arXiv:2605.07804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.043821Z"},"links":{"cited_paper":"/paper/2605.07804","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:0cfb18b9e45a079eefda6366f971164f1018684e4f2bae82334f9cb5287ae4f9","observation_id":"d68fd257-bf0c-40a9-a24e-68921b98d35d","resolution":{"observed_at":"2026-08-12T14:39:46.043821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.15912","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.719203Z","title":"arXiv preprint arXiv:2606.15912 , year=","venue":null,"work_id":"10055492-1f63-444d-b3b6-908f9f621fe0","year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.049207Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:486176f3b090c315ce542201d655bc9bf3cc89fd6238ffb3179cb6fdb958c5b6","observation_id":"f19864cc-d5f0-4f6a-a900-7f7dc2724d54","resolution":{"observed_at":"2026-08-12T14:39:46.728227Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-16T08:35:41.330991Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-12T14:39:46.055258Z","title":"arXiv preprint arXiv:2602.12125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.055258Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:eec676482af970a15fad473149d1f091401fffc9ad6977d1a13a7e9e570e8ebb","observation_id":"eb2babd1-ef31-4907-a869-91490276a024","resolution":{"observed_at":"2026-08-12T14:39:46.055258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T14:39:46.060516Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.060516Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:c06aeddc26fbad8d447415b901053caa95e47c2fe154730a318cddc2aeb1bc0b","observation_id":"e91679fb-98fe-4157-8c65-bdf17d9eb924","resolution":{"observed_at":"2026-08-12T14:39:46.060516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-12T14:39:46.066297Z","title":"arXiv preprint arXiv:2504.11456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.066297Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:e4ed2941fd7e6f271b59a971d77932d240aeecdc08601ce58535e582291886f8","observation_id":"c1fa9861-4915-4db8-9567-62a3d40389c3","resolution":{"observed_at":"2026-08-12T14:39:46.066297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-12T14:39:46.072479Z","title":"arXiv preprint arXiv:2502.01456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.072479Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:118f8f8517b85ab4fd5249797b2cd7ce0bd0363c566bea2b6e5e66a1a52f4dce","observation_id":"7580330a-8805-4536-be66-7fe75869770e","resolution":{"observed_at":"2026-08-12T14:39:46.072479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.077825Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.077825Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:33994590e80ef4753380e85c59f63ba4136698c70288fa3b38be7c3743d129b2","observation_id":"8bb1a48c-370d-4b81-8fa3-035fa3c6b6a3","resolution":{"observed_at":"2026-08-12T14:39:46.077825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-12T14:39:46.082888Z","title":"arXiv preprint arXiv:2403.07974 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.082888Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:9d20b73f7dbe6bc68c0d8c6046a8da1871e8e23c7b81ca8ffcfee7e9f308d86b","observation_id":"269738fc-1e7c-4584-9491-cef1d2bda580","resolution":{"observed_at":"2026-08-12T14:39:46.082888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.089762Z","title":"Text summarization branches out , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.089762Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:dc1173d34f7d6534e58ee7ded0725c38367d7bc81298c13c2b2546cdc835d06c","observation_id":"e88856ec-4231-4695-9bf1-e8061f1c3531","resolution":{"observed_at":"2026-08-12T14:39:46.089762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-12T14:39:46.095380Z","title":"arXiv preprint arXiv:2203.02155 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.095380Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:092e374a8345bef69cf3bbd4112d4160f09cfb3592c06c26ccba60a92db5ba14","observation_id":"184fc7d6-e074-4579-b21a-0eb1ce6cddc9","resolution":{"observed_at":"2026-08-12T14:39:46.095380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-12T14:39:46.100426Z","title":"arXiv preprint arXiv:2305.18290 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.100426Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:80375065c45ef7bafe014e9ab9134ddb18b8282a2686733bfc6a75f5861346e1","observation_id":"bdae0362-71f4-4b52-8fef-18a393fb85b6","resolution":{"observed_at":"2026-08-12T14:39:46.100426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:47.030283Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"0b110ead-108b-4447-99ce-5a26c901edf9","year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.106810Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:e8fafad30b5c83548ab2de4a06a59b476bb9371cd300d1e448bd15d60c27a826","observation_id":"3edabfb3-3e26-448b-b10b-abbe1d0caeaa","resolution":{"observed_at":"2026-08-12T14:39:47.036191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:47.013267Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"a3505d8f-b509-4cdd-8b89-83d7226a7c29","year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.111883Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:129146ba3bc50ba5d0c22a274a58d3cb8e5ce2748523b8ab56be5df15f085e5b","observation_id":"da3aaf97-a7d4-426f-a2d6-fcd4baa43ded","resolution":{"observed_at":"2026-08-12T14:39:47.018741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10416","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.477329Z","title":"arXiv preprint arXiv:2601.10416 , year=","venue":null,"work_id":"ddce5bcf-001e-49dc-bc0e-df1e45e11871","year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.117026Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:6bcc14bcdc42c58358e9625f5f995b95e40763e04112806cf4aafd37044798d1","observation_id":"9953c594-f739-4e8d-8613-075c24ffe4ac","resolution":{"observed_at":"2026-08-12T14:39:46.487445Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.122078Z","title":"Proceedings of the 26th annual international conference on machine learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.122078Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:5da4f7b12feb8f2b209693c692b556fc99d4678a5af1f48042a09b1e6c206008","observation_id":"defe5278-ac67-4b3c-b8fc-e7a06fe39209","resolution":{"observed_at":"2026-08-12T14:39:46.122078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.127047Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.127047Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:92a9a5d8dffa35237ec913cc95f13d3b208d9f2258deb3f1a7548971c4b1f430","observation_id":"0179a930-434c-4738-90df-ead48e168ff2","resolution":{"observed_at":"2026-08-12T14:39:46.127047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-08-12T00:58:13.334263Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21606","snapshot_observed_at":"2026-08-12T14:39:46.133085Z","title":"arXiv preprint arXiv:2605.21606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.133085Z"},"links":{"cited_paper":"/paper/2605.21606","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:ba27de3b96edc2ca923f5d5f813bb9f501aac178e5b0e45d785d4e5906e81e46","observation_id":"1f5625a7-c50f-4681-b4f2-681ab274df17","resolution":{"observed_at":"2026-08-12T14:39:46.133085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.21994","last_updated":"2026-08-03T09:13:52Z","snapshot_observed_at":"2026-08-15T03:30:22.565994Z","submitted_at":"2026-06-20T11:18:34Z","title":"Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts","version":2},"cited_work":{"arxiv_id":"2606.21994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.21994","snapshot_observed_at":"2026-08-12T14:39:46.264597Z","title":"Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts","venue":"cs.LG","work_id":"08b8df6c-2e02-4141-bc4f-9076cc2a8f8e","year":2026},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.139168Z"},"links":{"cited_paper":"/paper/2606.21994","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:d5c724c2e031ca9fa75d080f7113e9d5ce45c0e3aa0682c284136844f6e04b19","observation_id":"65a81404-6565-486e-88ff-963f8521f1f9","resolution":{"observed_at":"2026-08-12T14:39:46.269809Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"cited_work":{"arxiv_id":"2607.04037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04037","snapshot_observed_at":"2026-08-12T14:39:46.237545Z","title":"Reward-Gated On-Policy Distillation","venue":"cs.LG","work_id":"a57832ce-817b-4e72-b9fb-418e95014e59","year":2026},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.145211Z"},"links":{"cited_paper":"/paper/2607.04037","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:6484590503231ada903b87c100e256068aa8e13ba5f2bb4fbdd4f2982416b311","observation_id":"e9198a1b-9d49-494d-b97d-d09a9df0c6d0","resolution":{"observed_at":"2026-08-12T14:39:46.245029Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.972521Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"abcbd51f-d01d-409e-979b-8b4707bff8ce","year":null},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.154393Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:79f00ac1d8fa5899aaf5204b10c54f3d18d6ad34fe2023c5641445dff4548a20","observation_id":"ab6d7418-dfdb-4d3c-88ec-c4458b83af2d","resolution":{"observed_at":"2026-08-12T14:39:46.977780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.160136Z","title":"International journal of computer vision , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.160136Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:d0b18b48773591838954b3cffae89b256972b53615c113c8a881f2e3382b0d74","observation_id":"a4ce385b-93da-48f2-b062-fb9a4ec21387","resolution":{"observed_at":"2026-08-12T14:39:46.160136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.166476Z","title":"international conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.166476Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:a9637a9e5eaac99a5e506ae78b8b10902d70c587b8b2aaafd44fc99b06b441b9","observation_id":"2cd224ed-98fe-4d64-ba3b-6e05dd42407f","resolution":{"observed_at":"2026-08-12T14:39:46.166476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.172669Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.172669Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:3f5d25fc37aba472fd394bd2059da4a8c535847fbb62ce888c63b94d162e306b","observation_id":"b0999f33-befe-4185-8f88-b45d660f6a71","resolution":{"observed_at":"2026-08-12T14:39:46.172669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.178809Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.178809Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:2bc13dc7a42eea009500bf3d672e383a879d33c7d753a9b1788828513106a832","observation_id":"ee9344eb-a9bf-4389-80c2-cf103debeef1","resolution":{"observed_at":"2026-08-12T14:39:46.178809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.184918Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.184918Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:74805f9b27d9cd4352edad1c5f04f6cb480935758bb3325752152e6f46138aed","observation_id":"9c296c43-78c3-4cf9-a250-5e1c894beaa7","resolution":{"observed_at":"2026-08-12T14:39:46.184918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:39:46.192328Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.192328Z"},"links":{"citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:83d9f1543adf3a69252c210bd05334bd23372ebf46a4ad9c18c869dd60c8b0df","observation_id":"cd8499c4-26fa-4f2b-86b8-80da131e98f6","resolution":{"observed_at":"2026-08-12T14:39:46.192328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.10905."}