{"as_of":"2026-08-10T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4c39f42416e2469759a69db42bcfc08877c4c8872383feb4b82906f4e67cae4","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:13:56.042393Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:21:09.717262Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13124","snapshot_observed_at":"2026-08-04T04:21:09.717262Z","title":"arXiv preprint arXiv:2607.13124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-08T07:33:00.302384Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.717262Z"},"links":{"cited_paper":"/paper/2607.13124","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:22154fa9efe423c2850980fdb5a4c8c7337ee1173629ee21435c953e7bc4cf08","observation_id":"2dfe51cd-26ce-4516-8c0d-effef46be78d","resolution":{"observed_at":"2026-08-04T04:21:09.717262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13124","snapshot_observed_at":"2026-07-30T11:44:37.034752Z","title":"Shortopd: Recovering pruned llms with short-to- long on-policy distillation.arXiv preprint arXiv:2607.13124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27081","last_updated":"2026-07-29T16:07:19Z","snapshot_observed_at":"2026-08-08T05:44:42.516793Z","submitted_at":"2026-07-29T16:07:19Z","title":"On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T11:44:37.034752Z"},"links":{"cited_paper":"/paper/2607.13124","citing_paper":"/paper/2607.27081"},"observation_digest":"sha256:b4dcd13e300e8daa5b4395f7e66dbf6afaf8636e252dcec5d6da45af752c6c49","observation_id":"61e61b6b-01f6-4e19-8ba0-0a5ea3526c76","resolution":{"observed_at":"2026-07-30T11:44:37.034752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13124","snapshot_observed_at":"2026-08-03T05:56:32.554568Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29494","last_updated":"2026-07-31T15:02:53Z","snapshot_observed_at":"2026-08-10T01:54:24.399316Z","submitted_at":"2026-07-31T15:02:53Z","title":"Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T05:56:32.554568Z"},"links":{"cited_paper":"/paper/2607.13124","citing_paper":"/paper/2607.29494"},"observation_digest":"sha256:9cc17524d1fe4b5a597521e1f2b3fd86ea0307c51d3005ccab8288456461003b","observation_id":"f7a55579-28d9-413b-b505-3b28b724d7f8","resolution":{"observed_at":"2026-08-03T05:56:32.554568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.13124/citation-record","integrity":"/paper/2607.13124/integrity","json":"/paper/2607.13124/citation-record.json","paper":"/paper/2607.13124"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T06:13:50.733093Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.733093Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:27d82f15268d6ff1eef96c5fba98927db4abe21cc0b143b7aa501019b82912ff","observation_id":"05495e38-88c2-409c-813c-cf74dbfa49ec","resolution":{"observed_at":"2026-08-02T06:13:50.733093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T06:13:50.834020Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.834020Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:db511c19aaf96d1bcc8c8ac0e7bf2425bc63918a2a9b344daa9e9cc9897b9915","observation_id":"59a18c68-ba1d-424c-ac6d-e2e404c2f5f7","resolution":{"observed_at":"2026-08-02T06:13:50.834020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:50.939626Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.939626Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:011c02ecd8ef8ca12cb93dd1502d85e6d434c6c13f8b95ccfed5d01d7e33b52d","observation_id":"bac50476-99a8-40d7-89f2-d194284c570c","resolution":{"observed_at":"2026-08-02T06:13:50.939626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.058227Z","title":"Slicegpt: Compress large language models by deleting rows and columns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.058227Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:321fb8c7dceee7a79d319fa53aaae449607a2875febe6fb978f1fd29d28be02a","observation_id":"b2801b24-01d1-4d08-9a74-b0cdcfe29383","resolution":{"observed_at":"2026-08-02T06:13:51.058227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.132532Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.132532Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:847c03e66b1c237b31887dedaee06c5ad5d73886b23673d37baa6d004b532de4","observation_id":"98a75319-c8e5-4d1d-9272-a1cab40e5f0a","resolution":{"observed_at":"2026-08-02T06:13:51.132532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.220978Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.220978Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:31cd053e5f93747bae2704eebc9d279285b57b98a45358806d8022def576d06d","observation_id":"447b6d32-80d7-4faf-b909-c9019dd736cf","resolution":{"observed_at":"2026-08-02T06:13:51.220978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.290260Z","title":"Compact language models via pruning and knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.290260Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:c816b631a99d65563578ddf6d4597bad3ea605df6df96030e088d6da19570c2d","observation_id":"b65ef1c2-dbac-4242-8ede-ca3324d1dac7","resolution":{"observed_at":"2026-08-02T06:13:51.290260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.430620Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.430620Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:99d5f0b21ef19e37a600d18705f63e2f36a4ea95e9542bf0b51b5f5516d83bcb","observation_id":"18d4b32c-1a95-4b5d-a7ed-1b7a59dfe25d","resolution":{"observed_at":"2026-08-02T06:13:51.430620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.480116Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.480116Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:b6c6eab95218c1bed9e870ab7b20a746348345f0205957edd4adff60a791af51","observation_id":"092b3969-111e-4379-833b-01624dcfca21","resolution":{"observed_at":"2026-08-02T06:13:51.480116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.546450Z","title":"Awq: Activation-aware weight quantization for llm compression and acceler- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.546450Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:232b879f3d8beb701b2541a0559bcc6bda7455936e2390488efea5213916dbec","observation_id":"61d1f87c-c33c-4436-b10a-27bb40d92fcf","resolution":{"observed_at":"2026-08-02T06:13:51.546450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.648459Z","title":"Fluctuation-based adaptive structured pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.648459Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:e36c50b5169bb8de10af22c04626ca0ee5f091af1bd08c777f57c94c85114de5","observation_id":"9ca4910d-192a-464a-aa0b-a2d7a2b45f2e","resolution":{"observed_at":"2026-08-02T06:13:51.648459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-08-07T23:10:12.222808Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-08-02T06:13:51.714816Z","title":"Shortened llama: Depth pruning for large language models with comparison of retraining methods.arXiv preprint arXiv:2402.02834, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.714816Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:0315dcfe0d4dfa3f1c1cf9dfc19d0a518905d415400afc1f4479b46e67a57ec8","observation_id":"90b85378-7099-4928-9953-33e05e129f27","resolution":{"observed_at":"2026-08-02T06:13:51.714816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.786642Z","title":"The unreasonable ineffectiveness of the deeper layers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.786642Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:6ac7d8ec4051d320822e8ead7c11d28c2651cfca607c21a135a84e142f3781dc","observation_id":"e203ea91-0583-4939-a257-1781b16f1d00","resolution":{"observed_at":"2026-08-02T06:13:51.786642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.856938Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.856938Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:a97ae8c2d17e8ab967c2eaba19f3cd917536b0a9852560567676faa50778b97f","observation_id":"f5951686-c711-4db2-bed7-9eaaf68a9664","resolution":{"observed_at":"2026-08-02T06:13:51.856938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.944481Z","title":"Hellaswag: Can a machine really finish your sentence? InAnnual Meeting of the Association for Computational Linguistics (ACL), 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.944481Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:35fc748db5c99b14b6df2895d7f124cec558552f924ab0898a503b25abb85e1a","observation_id":"fc40ada5-e662-4a22-b5b9-587583dbe7ab","resolution":{"observed_at":"2026-08-02T06:13:51.944481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17609","last_updated":"2026-06-16T07:14:52Z","snapshot_observed_at":"2026-08-03T15:12:23.597583Z","submitted_at":"2026-06-16T07:14:52Z","title":"The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17609","snapshot_observed_at":"2026-08-02T06:13:52.012484Z","title":"The benchmark illusion: Pruned llms can pass multiple choice but fail to answer.arXiv preprint arXiv:2606.17609, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.012484Z"},"links":{"cited_paper":"/paper/2606.17609","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:00199d24b5eeb99001630f713f9e4580caa540f15199f0d7ed4c540c5c7315d5","observation_id":"a00f185f-1008-4ab3-89cd-12e219de46ee","resolution":{"observed_at":"2026-08-02T06:13:52.012484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-02T06:13:52.078035Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.078035Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:7d30e73c8319f367cef4376cac377d6eb68f64ba378ec48cc32c10db96f37056","observation_id":"af178499-47e5-4b3d-a294-ce4a1197e2b3","resolution":{"observed_at":"2026-08-02T06:13:52.078035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T06:13:52.185791Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.185791Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:60b383165170b4abe608895b518b2b62569ef40e80cb4823b3d9f20e4fef33b9","observation_id":"b2de341b-7f6f-458a-9d89-f4783912ea1c","resolution":{"observed_at":"2026-08-02T06:13:52.185791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.395465Z","title":"Sequence level training with recur- rent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.395465Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:4c51a71559f21727d5a4412de1c62deaff26ab63d01f61714b03a71dd4a4bea2","observation_id":"f92c7253-6d76-4f44-9c07-fdd2061fdd7d","resolution":{"observed_at":"2026-08-02T06:13:52.395465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.549293Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.549293Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:78ca649cf76ea676ca38c0a7814fb6e28fa779a9a591e01cf411b611c38bdb14","observation_id":"04bb9010-73a1-4e7d-bc22-ef70ddc337e8","resolution":{"observed_at":"2026-08-02T06:13:52.549293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T06:13:52.717632Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.717632Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:758c5ebe1dff4fa7a46ef5dc51e8180784f4166efb2c4045fe9580dd1fffb9b0","observation_id":"dabbd62a-fe92-4b96-a798-9531be65ca9e","resolution":{"observed_at":"2026-08-02T06:13:52.717632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T06:13:52.935572Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.935572Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:02a3a41ad90d6dc3a514cc946d9d7501b62f095ef2728f51129db957df2d3b3d","observation_id":"3160d23c-ec95-4040-a91c-803f0b925421","resolution":{"observed_at":"2026-08-02T06:13:52.935572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.093884Z","title":"Sequence-level knowledge distillation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.093884Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:eba117fe44777069270db5c7858ffb0a358f97657142f8fab7b88d35b8896003","observation_id":"5313e3eb-834f-42db-b8cf-601a754cafa3","resolution":{"observed_at":"2026-08-02T06:13:53.093884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18740","snapshot_observed_at":"2026-08-02T06:13:53.238015Z","title":"Vision-opd: Learning to see fine details for multimodal llms via on-policy self-distillation.arXiv preprint arXiv:2605.18740, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.238015Z"},"links":{"cited_paper":"/paper/2605.18740","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:25c14429389f67478fd54ece90ddade8b9d5166a28735d73cb24074dac88c20d","observation_id":"9ed40101-740c-4462-900d-3ebc0969e68c","resolution":{"observed_at":"2026-08-02T06:13:53.238015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.357398Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.357398Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:ebf290c8917d92e81692ed93fb7c6e36710ea6a4e5c301575e2c038a05e6c84a","observation_id":"78aa3d74-6feb-44d6-936a-ff738338db62","resolution":{"observed_at":"2026-08-02T06:13:53.357398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.538637Z","title":"Learning to break the loop: Analyzing and mitigating repetitions for neural text generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.538637Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:452af3471764fcf660b5d2828f2f5a13faa0a663635d11443a3f4042e5ae37c3","observation_id":"0f00dc62-5eb6-49bb-8edf-122584093759","resolution":{"observed_at":"2026-08-02T06:13:53.538637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.626628Z","title":"Laco: Large language model pruning via layer collapse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.626628Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:0b0ea80532db4d8694687c3d14b557f2ca376f32d16b8f596a68082c86a06f1c","observation_id":"f9798946-738c-48ab-9ab9-21b4c24f6905","resolution":{"observed_at":"2026-08-02T06:13:53.626628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.811763Z","title":"Shortv: Efficient multimodal large language models by freezing visual tokens in ineffective layers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.811763Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:12947330ee11e21190f837a063331b24f5da7221cc11bcb8bb2f40aa03080c88","observation_id":"3eaf089d-7a60-42da-953b-1dfa8d99b9f1","resolution":{"observed_at":"2026-08-02T06:13:53.811763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.939812Z","title":"Everybody prune now: Structured pruning of llms with only forward passes.arXiv preprint arXiv:2402.05406, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.939812Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:5e6a7c0be7abc26409c29745025b39f9dc8bebd9471341cea892b9ab10a703c7","observation_id":"2b60f8fe-4039-475e-8415-daccc91cbe80","resolution":{"observed_at":"2026-08-02T06:13:53.939812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11796","last_updated":"2024-12-09T18:31:01Z","snapshot_observed_at":"2026-08-07T10:56:20.468878Z","submitted_at":"2024-08-21T17:38:48Z","title":"LLM Pruning and Distillation in Practice: The Minitron Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11796","snapshot_observed_at":"2026-08-02T06:13:54.023861Z","title":"Llm pruning and distillation in practice: The minitron approach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.023861Z"},"links":{"cited_paper":"/paper/2408.11796","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:3ee12cc555ba61feec49478121b950bee44435ee3d3a2a034f62bfdb903c0b75","observation_id":"c04183cb-d4b0-440b-9d57-4a61ba1b9793","resolution":{"observed_at":"2026-08-02T06:13:54.023861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-02T06:13:54.112330Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.112330Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:56f9433df587c238ef4ddbb8f93b2c8dd374385976e62f542bc8c5a7676d9502","observation_id":"692bf304-c130-4733-a940-4c62977bc173","resolution":{"observed_at":"2026-08-02T06:13:54.112330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.291104Z","title":"Autoregressive knowledge distillation through imitation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.291104Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:bbd8d5150b9b21f467d1f79fc25f8c7b60d1b41e910a67bb5db24e6b0b9fbb63","observation_id":"063a0a2e-7776-43fb-8c5a-d3186026af8f","resolution":{"observed_at":"2026-08-02T06:13:54.291104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.498708Z","title":"Minillm: On-policy distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.498708Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:f67188ee19e6536eb52bc3397c13bafed36d5f4232815eb44a7281af383df40e","observation_id":"674bed9f-6553-4c2a-bd84-87c1c20744fb","resolution":{"observed_at":"2026-08-02T06:13:54.498708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.607136Z","title":"f-divergence minimization for sequence-level knowledge distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.607136Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:dff4c0d40ef8fe2df984d6365cfea1c84f45d595d815686be741918a9dc8a7c3","observation_id":"ce47cacf-02d3-48b6-8bdb-df892ea4b61b","resolution":{"observed_at":"2026-08-02T06:13:54.607136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.686739Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.686739Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:ae8ada408cdb61a48573554c2e4aa5b2267ab802076b36b45cee30fa37d97d44","observation_id":"4cf03823-4f2a-4e9b-8d67-46f5e0252d6d","resolution":{"observed_at":"2026-08-02T06:13:54.686739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.766889Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.766889Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:f9d7aefaa26e537876b5fccd4b33c0e8a781fb4524ebb58594e6f8fe8876e4f0","observation_id":"51638354-1de4-4c03-bc45-513f77a2f90c","resolution":{"observed_at":"2026-08-02T06:13:54.766889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.856534Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.856534Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:7ea290a027432827dbccf16dbb11cea957c8c13a8b99643cc24ee6508636b894","observation_id":"708f36d5-34e8-43a9-9dde-760c942c83f9","resolution":{"observed_at":"2026-08-02T06:13:54.856534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T06:13:55.039137Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.039137Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:48c607502b9504220ef96db400f17de20ed78757c82239e22e0e982c81d94877","observation_id":"c7f38387-6fa5-4d06-8407-10b71816342c","resolution":{"observed_at":"2026-08-02T06:13:55.039137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.238285Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.238285Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:7aeda66c4d205ee242112df17fea0cd6f68e1cca377def96ad382eeea77ec0d1","observation_id":"9bb3807e-8072-4dfd-9f64-8a0cdeb1434c","resolution":{"observed_at":"2026-08-02T06:13:55.238285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.418696Z","title":"Opencodeinstruct.https://huggingface.co/datasets/nvidia/OpenCodeInstruct, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.418696Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:dfe5928b54a66015af9043a3d7c3dbb0d0cc7fb488d550f1ce60d735240f11bb","observation_id":"b774555d-5d2e-45de-9f48-4967f1691e10","resolution":{"observed_at":"2026-08-02T06:13:55.418696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-02T06:13:55.557330Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.557330Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:30de0868850866948d995dc3cd016f6eac65ac57d2415177eff2b40c3b70a724","observation_id":"230d03e4-7dc9-450f-bb56-eccd7e75b4b9","resolution":{"observed_at":"2026-08-02T06:13:55.557330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.708035Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90% chatgpt quality.https://lmsys.org/blog/2023-03-30-vicuna/, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.708035Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:ac20c92739c4fbf1567eb0b0e5bb59a8af7b487a86c959c0969ea3ce4f3991c6","observation_id":"5d57a98e-3cb1-442d-96d1-d2c17c8ebf9d","resolution":{"observed_at":"2026-08-02T06:13:55.708035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.904741Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.904741Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:3f3d1fa2f4fa292e4e478b84fa3dc9b4da62ce712173f7cfdf21c6f072682512","observation_id":"7b2fd1c5-bada-42fd-b5ce-f41c52d4e1e4","resolution":{"observed_at":"2026-08-02T06:13:55.904741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:56.042393Z","title":").\").\")","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.042393Z"},"links":{"citing_paper":"/paper/2607.13124"},"observation_digest":"sha256:bef0a3630f71af78de34d032ea64905ae351948e6a979160929f5104c57e7db6","observation_id":"f804196f-7868-49a1-8021-a8980a185687","resolution":{"observed_at":"2026-08-02T06:13:56.042393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13124","last_updated":"2026-07-14T17:50:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T03:30:20.862684Z","submitted_at":"2026-07-14T17:50:50Z","title":"ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 3 inbound Pith citation observations for arXiv:2607.13124."}