{"as_of":"2026-08-19T08:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2f38f8d105624d5a7a4f58f537f8b22c4f3ce4d27358650cd7da99983fd4c3b","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:40:42.303146Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T02:56:58.020990Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.19046","snapshot_observed_at":"2026-07-31T02:56:58.020990Z","title":"Contrastive on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-10T13:40:32.070762Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.020990Z"},"links":{"cited_paper":"/paper/2607.19046","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:397a608ca3e9b4bb445de72b09df08fffba7553a72c6fc4f6c49f6b9a3fb80cf","observation_id":"b0a6f67f-5f37-47ee-b93b-757d35002dfa","resolution":{"observed_at":"2026-07-31T02:56:58.020990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.19046/citation-record","integrity":"/paper/2607.19046/integrity","json":"/paper/2607.19046/citation-record.json","paper":"/paper/2607.19046"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:38.307846Z","title":"On-policy distillation of language models: Learning from self- generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:38.307846Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:d3465dd8d1a837b244b63a983077ac2d02da59f436702fa0ebe00428463ffa96","observation_id":"30875ada-ecfa-400f-9ba8-660e9f1730b1","resolution":{"observed_at":"2026-08-01T13:40:38.307846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:38.846295Z","title":"Token- budget-aware llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:38.846295Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:2048bcb089f51c7a674aca099302a20e6fa9bd7a2127efba867aadf7fc29fc31","observation_id":"8c49b3ca-de7a-4177-aff0-e6af4e1790fd","resolution":{"observed_at":"2026-08-01T13:40:38.846295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-01T13:40:38.957682Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:38.957682Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:944aa819ec96f3b2877a803af292457827872befcfaa9cb75f19f6daefc7f8f6","observation_id":"903893c7-1265-44bf-8876-72235cb4514b","resolution":{"observed_at":"2026-08-01T13:40:38.957682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:39.315192Z","title":"Towards reasoning in large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.315192Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:3797e9a48cbbfeae4d84f562292f65a8663e523277322460575f565b3b12a05f","observation_id":"f1406273-a49b-48e4-8b0c-b97a6a496546","resolution":{"observed_at":"2026-08-01T13:40:39.315192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:39.479014Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.479014Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:ed64167145f708bc024eb34dd58dd1f13f9ee7549fa63266f5e08f5b87aad475","observation_id":"7d1845b8-5392-4db0-9e63-e9c60616a0c9","resolution":{"observed_at":"2026-08-01T13:40:39.479014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10822","last_updated":"2025-06-12T15:43:01Z","snapshot_observed_at":"2026-08-16T08:04:34.082952Z","submitted_at":"2025-06-12T15:43:01Z","title":"ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10822","snapshot_observed_at":"2026-08-01T13:40:39.777071Z","title":"Efficient multimodal large language models: A survey.Visual Intelligence, 3(1):27, 2025a","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.777071Z"},"links":{"cited_paper":"/paper/2506.10822","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:a88e99cda296a09253e6982d96bc89be4388504fa33443714b07aad3a425ed0b","observation_id":"d58fab11-0a67-4879-9243-c240d0895db4","resolution":{"observed_at":"2026-08-01T13:40:39.777071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-01T13:40:39.884234Z","title":"Leash: Adaptive length penalty and reward shaping for efficient large reasoning model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.884234Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:365d9730bf3fede384b093945e85e443e31b68b7865454a68e36cdecca7ac2bb","observation_id":"5c5f1829-1eee-49db-86f4-8c17142f2de1","resolution":{"observed_at":"2026-08-01T13:40:39.884234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-08-16T21:45:56.892632Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21924","snapshot_observed_at":"2026-08-01T13:40:39.971688Z","title":"Visual-advantage on-policy distillation for vision-language models.arXiv preprint arXiv:2605.21924,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.971688Z"},"links":{"cited_paper":"/paper/2605.21924","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:518a00fc7f251fc11b8db11279216b089fd759273fc3854ac8b87ca4e1ea59d1","observation_id":"57c1594c-7118-48e8-aeb2-cc80aa204c6a","resolution":{"observed_at":"2026-08-01T13:40:39.971688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:40.065268Z","title":"Dler: Doing length penalty right-incentivizing more intelligence per token via reinforcement learning.arXiv preprint arXiv:2510.15110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.065268Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:8ea3ba1da650dc4b5d68a4148c77b4b0c72e23a3387d8ab5d0d7466e4bd12c1b","observation_id":"e5a7d63c-ee68-4eef-bff6-80eb742f0be1","resolution":{"observed_at":"2026-08-01T13:40:40.065268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-01T13:40:40.174032Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.174032Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:45e8848169bdad5cedc31ccb1e124558f9f601a8d22b93992c017b879ef9296f","observation_id":"aad17fb9-1e44-40e3-a6a7-ba6c09acaf89","resolution":{"observed_at":"2026-08-01T13:40:40.174032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:40.283470Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.283470Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:529c9bb0544642f9a22dd5db86ee9a1286bbbf337e84635ca3512599eed88ab7","observation_id":"1f9feb8b-a01f-4f7a-96e8-4a0cec92c587","resolution":{"observed_at":"2026-08-01T13:40:40.283470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:40.393311Z","title":"Self- training elicits concise reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.393311Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:923bb41f6a7f2a2047147b47d77f5800823bfc68555c3cc4d310e3a162705e9b","observation_id":"847d59a2-057f-4214-a84a-3f63f6449b3e","resolution":{"observed_at":"2026-08-01T13:40:40.393311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19825","last_updated":"2025-01-23T08:45:52Z","snapshot_observed_at":"2026-08-16T13:30:18.557142Z","submitted_at":"2024-07-29T09:21:52Z","title":"Concise Thoughts: Impact of Output Length on LLM Reasoning and Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19825","snapshot_observed_at":"2026-08-01T13:40:40.501299Z","title":"Concise thoughts: Impact of output length on llm reasoning and cost.arXiv preprint arXiv:2407.19825,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.501299Z"},"links":{"cited_paper":"/paper/2407.19825","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:6fdcc1afcc4a6c7ba8e21824b65b210d3c3f770b75c93ebf5f5071b71a5eb7af","observation_id":"9d6985be-4572-40fe-b205-e5ad8f2cbde7","resolution":{"observed_at":"2026-08-01T13:40:40.501299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-08-15T16:24:55.947978Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07865","snapshot_observed_at":"2026-08-01T13:40:40.576451Z","title":"Kl for a kl: On-policy distil- lation with control variate baseline.arXiv preprint arXiv:2605.07865,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.576451Z"},"links":{"cited_paper":"/paper/2605.07865","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:a1abe215b80b7b4824c307bdfb30069cab99fc87f6a74a2b6f3efb3965816b77","observation_id":"522d74e7-f8a8-414f-83c6-b1d0751d96be","resolution":{"observed_at":"2026-08-01T13:40:40.576451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-01T13:40:40.685025Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.685025Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:c0dc410e380e8c031715dab277b91e8d506b7d90af205970e8782a8d508a0fdd","observation_id":"5b3b8c12-6253-4733-8524-2de3eadc56a3","resolution":{"observed_at":"2026-08-01T13:40:40.685025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-08-15T18:08:07.785375Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-08-01T13:40:40.794672Z","title":"Crisp: Com- pressed reasoning via iterative self-policy distillation.arXiv preprint arXiv:2603.05433,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.794672Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:b72a204e2e74ebccaad04c67fd88827f4cc758b49aa0c2da222e793c0fd32abc","observation_id":"df6d35f7-d248-414b-81a1-cefa399d0993","resolution":{"observed_at":"2026-08-01T13:40:40.794672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-01T13:40:40.904501Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.904501Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:0b301566ef175fc3895497fd3a8c5e48373e17ff3acb86b243aea914e46f0b7e","observation_id":"5c89e43b-43ea-4b8f-846a-00eb38933f4d","resolution":{"observed_at":"2026-08-01T13:40:40.904501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-08-01T13:40:41.241326Z","title":"A survey of on-policy distillation for large language models.arXiv preprint arXiv:2604.00626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.241326Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:b687b2cd001314f23f602f5e314776c00fff8d37017beb711e60a277a2dacad2","observation_id":"7b4a38b5-d77d-4204-930e-d3b1fc7f4217","resolution":{"observed_at":"2026-08-01T13:40:41.241326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:41.320027Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.320027Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:a761ee9c36c852e036190f6794c8775eea08d86537e0161196a567aa25164290","observation_id":"d0c01b0a-6ec4-4b85-9cab-755df1189ce5","resolution":{"observed_at":"2026-08-01T13:40:41.320027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T13:40:41.385416Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.385416Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:e4298663d5e1667c7bb974c1ad5cb3755de2b66c224b33e012ed14d7e1ca1cde","observation_id":"802b0075-64d9-4aa9-b4cb-c6f5934b3d21","resolution":{"observed_at":"2026-08-01T13:40:41.385416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-01T13:40:41.570637Z","title":"Yijia Xiao, Edward Sun, Tianyu Liu, and Wei Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.570637Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:26a137d359ed3a73a12caaf22e6e8d8930514692dd10fc766481f9ca2c2a01b1","observation_id":"23c56f0b-43e9-44c7-b206-2c7f92f559b7","resolution":{"observed_at":"2026-08-01T13:40:41.570637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-16T08:35:41.330991Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-01T13:40:41.663241Z","title":"Learning beyond teacher: Generalized on-policy distillation with reward extrapolation.arXiv preprint arXiv:2602.12125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.663241Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:04c2fb3d48338cf285b3f2475eb6672041e302427b332455b6924b48f9683e4c","observation_id":"3b02a138-aef3-482a-af09-b333fc7aaa85","resolution":{"observed_at":"2026-08-01T13:40:41.663241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-08-13T22:55:34.534879Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05040","snapshot_observed_at":"2026-08-01T13:40:41.757803Z","title":"Preference- based self-distillation: Beyond kl matching via reward regularization.arXiv preprint arXiv:2605.05040,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.757803Z"},"links":{"cited_paper":"/paper/2605.05040","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:7f154fe09b1c8867d296950a4ff0b0c67322179f1f65addfc40cb3aebeeb0fe8","observation_id":"ed59648d-76be-4a61-9bd2-e75318123df3","resolution":{"observed_at":"2026-08-01T13:40:41.757803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22437","last_updated":"2026-06-25T12:10:03Z","snapshot_observed_at":"2026-08-14T07:50:04.090458Z","submitted_at":"2026-06-21T10:57:43Z","title":"MMGist: A Comprehensive Multimodal Benchmark for 2027","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22437","snapshot_observed_at":"2026-08-01T13:40:41.853449Z","title":"Mmgist: A comprehensive multimodal benchmark for 2027.arXiv preprint arXiv:2606.22437,","venue":null,"work_id":null,"year":2027},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.853449Z"},"links":{"cited_paper":"/paper/2606.22437","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:9174f3f4b032a7b049b5385c5ccde04061fb041d12133ce613f8203e3f82439f","observation_id":"1322fb1a-f495-4520-8c46-7e9ccac9fd1c","resolution":{"observed_at":"2026-08-01T13:40:41.853449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-16T18:17:11.146813Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-01T13:40:41.931136Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.931136Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:0f003ed7168e7df0bf4298ce9266d35d354e7133a260f3f452cb176030cf9a03","observation_id":"64a3584e-895e-485a-9bd1-1fc5c6ebf4d6","resolution":{"observed_at":"2026-08-01T13:40:41.931136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09725","last_updated":"2026-08-11T04:34:14Z","snapshot_observed_at":"2026-08-15T21:14:17.875522Z","submitted_at":"2026-05-10T19:49:00Z","title":"On-Policy Distillation with Best-of-N Teacher Rollout Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09725","snapshot_observed_at":"2026-08-01T13:40:42.016315Z","title":"On-policy distillation with best-of-n teacher rollout selection.arXiv preprint arXiv:2605.09725, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:42.016315Z"},"links":{"cited_paper":"/paper/2605.09725","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:b49f3bb2036784376e7d1aa50677f1afeefa4d4b0e9f0093f7c29d047dbc72b7","observation_id":"38755796-b319-4f5e-9c80-a0dbf5a873ee","resolution":{"observed_at":"2026-08-01T13:40:42.016315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31490","last_updated":"2026-05-29T16:12:54Z","snapshot_observed_at":"2026-08-13T02:30:39.456000Z","submitted_at":"2026-05-29T16:12:54Z","title":"Are Full Rollouts Necessary for On-Policy Distillation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31490","snapshot_observed_at":"2026-08-01T13:40:42.104085Z","title":"Are full rollouts necessary for on-policy distillation? arXiv preprint arXiv:2605.31490, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:42.104085Z"},"links":{"cited_paper":"/paper/2605.31490","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:1a0beeae0a8f771a423f0a1f03bd74cdb8763dcb45a9ba6691c9eb56c30f3f47","observation_id":"c05e428a-a217-4cab-ab87-f693ae0da0f2","resolution":{"observed_at":"2026-08-01T13:40:42.104085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-01T13:40:42.188116Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:42.188116Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:eeb41b52320390e85051b37d9c27e8ee9f577d00badf2ae98c774ca40b65144d","observation_id":"e02bf4e0-af28-4418-8c1a-e0867d0bd2b7","resolution":{"observed_at":"2026-08-01T13:40:42.188116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-16T05:27:41.446467Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-01T13:40:42.303146Z","title":"Least-to-most prompting enables complex reasoning in large language models.arXiv preprint arXiv:2205.10625,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:42.303146Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:a8007b4b78fe17a87d7fa9d5d68230d08b050ba216115f5a5a72a5d8d723a2b7","observation_id":"8e81c10a-9b37-4880-aeb6-baf2e04a98ba","resolution":{"observed_at":"2026-08-01T13:40:42.303146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-12T12:02:18.586804Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-08-01T13:40:39.133263Z","title":"Uni-opd: Unifying on-policy distillation with a dual-perspective recipe.arXiv preprint arXiv:2605.03677,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.133263Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:cdd7dab7101b9cc604acd06570b8f530fcf2784a127bbccb672a16cfe0d30217","observation_id":"792371da-71a4-4db6-be0c-81cb3a40188d","resolution":{"observed_at":"2026-08-01T13:40:39.133263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T13:40:41.134065Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.134065Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:b47336ca9366605f5fe422b955ed74e55fdf39d55d00dda3e32eca324f802eb8","observation_id":"1831506d-096c-4787-b5a1-039f46404933","resolution":{"observed_at":"2026-08-01T13:40:41.134065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T13:40:41.009758Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.009758Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:8529cce0cdf23670c9918fe3b60c5a903471706302a9ff4d8e38bdb9e37a27e3","observation_id":"5819c389-0162-4f52-8f33-418f66d09db2","resolution":{"observed_at":"2026-08-01T13:40:41.009758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-01T13:40:39.620771Z","title":"Entropy-aware on-policy distillation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.620771Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:0f26b31f1dc1a24ae31206058bd2a7d2d156d84b44a4280ea0a77b019698fac5","observation_id":"7b2d1f50-d97f-44f2-b96b-b1c5f967de59","resolution":{"observed_at":"2026-08-01T13:40:39.620771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:38.714350Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:38.714350Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:826a81ade254c48c825c6ee53d604156a20abcd379222f2abace8495b4e6d879","observation_id":"d1b273f8-0ebb-45bd-b07e-7726f5597dcb","resolution":{"observed_at":"2026-08-01T13:40:38.714350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-18T12:35:17.774398Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-01T13:40:41.475804Z","title":"When more is less: Understanding chain-of-thought length in llms.arXiv preprint arXiv:2502.07266,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:41.475804Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:0853e0c9d6c08023cd1459ba9045c3c6e387c2636ad3fe7b057f5f492018b7b0","observation_id":"e90466b8-eb43-471a-95c0-01e3bcb98525","resolution":{"observed_at":"2026-08-01T13:40:41.475804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T13:40:38.423347Z","title":"Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:38.423347Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:6c68b2915280c302e75639d14a4858b61004140d8e503c8804a1d1f455b0d6e1","observation_id":"801402f3-4ca1-4cdd-8c5f-c4991e062efd","resolution":{"observed_at":"2026-08-01T13:40:38.423347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17250","last_updated":"2025-05-22T19:56:35Z","snapshot_observed_at":"2026-08-18T16:22:43.400409Z","submitted_at":"2025-05-22T19:56:35Z","title":"ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17250","snapshot_observed_at":"2026-08-01T13:40:38.524310Z","title":"Are we on the right way for evaluating large vision-language models?Advances in Neural Information Processing Systems, 37:27056–27087, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:38.524310Z"},"links":{"cited_paper":"/paper/2505.17250","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:005d3b4591354f16fd733f8ca1aac71e20bcaee295a1f481875717ce8421f486","observation_id":"8c70757a-9ef0-403b-b493-63747d8b6beb","resolution":{"observed_at":"2026-08-01T13:40:38.524310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-01T13:40:38.612685Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:38.612685Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:28fda844736eab1355d3717950025253412ddadc29e9e2f631bf3dd48ff758f0","observation_id":"5354084a-f257-4407-a231-cfd33b4776ed","resolution":{"observed_at":"2026-08-01T13:40:38.612685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:40:39.197447Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:39.197447Z"},"links":{"citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:f4cb3286a19e9c6c133ba9dff885aa348c2917906ec22153d9a20d729e81986d","observation_id":"e6990f83-5cff-4127-8bcf-65fc1bc0012a","resolution":{"observed_at":"2026-08-01T13:40:39.197447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2607.19046."}