{"as_of":"2026-08-17T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0c47ada1e23db307e4f542aab6e0c02d901b43bfd3781d069883d97661ff984","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:17:44.291837Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09931/citation-record","integrity":"/paper/2608.09931/integrity","json":"/paper/2608.09931/citation-record.json","paper":"/paper/2608.09931"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:45.100978Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":"257edde7-1b63-4988-b8ff-af7d0910dcc9","year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.093580Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:03a64de258ef3efaf42c27f4fbfd864448933b52ab9a4f1706f1307bf3311fb1","observation_id":"ae13e2f6-3382-48db-9a68-58fc8f6be3a7","resolution":{"observed_at":"2026-08-11T04:17:45.105840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T04:17:44.098478Z","title":"Qwen3-VL technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.098478Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:e53c0280ef3a5f5a312c2960efb7468a59ddba27521096eb11044e9b4a9a2853","observation_id":"80076d7a-3418-46d3-a740-9737c0d2d841","resolution":{"observed_at":"2026-08-11T04:17:44.098478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:45.088157Z","title":"Are we on the right way for evaluating large vision-language models?,","venue":null,"work_id":"a417b0b7-01c5-4f8a-a9c7-904c29415c10","year":null},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.103068Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:366b5228ff73a4eef227c2e5c26a5ae155e73cf396b7870874a7b825515c433b","observation_id":"a900038d-cf01-4383-ac3f-4711196d3526","resolution":{"observed_at":"2026-08-11T04:17:45.092767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:45.074748Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"7ad91629-fbb8-4273-a32a-89d5dd315e97","year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.112924Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:2714a7cae0cadda52f21bfa38e05c762baae4f3ea741b0720c7bb1d098fec047","observation_id":"5e56d924-b1b1-47f8-ae15-b64861b2dc4a","resolution":{"observed_at":"2026-08-11T04:17:45.079436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-11T04:17:44.118064Z","title":"Reinforced self-training (ReST) for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.118064Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:02e982376a37720c86ac312a7b081a5ce721e8cc9a18600463a0cdfe49135527","observation_id":"5b5082b8-5387-4225-a25a-dbce52dbfc6c","resolution":{"observed_at":"2026-08-11T04:17:44.118064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.122539Z","title":"Active-Zero: Self-evolving vision-language models through active environment exploration, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.122539Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:62657beb22805d570179ee1674baccdddea02c641ce25f1b527a206e93732c98","observation_id":"69a6b4cb-7eb2-4dd8-9b2a-095e2666057e","resolution":{"observed_at":"2026-08-11T04:17:44.122539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.127261Z","title":"VisPlay: Self-evolving vision-language models from images, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.127261Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:f8d912837b7f820192b701d6b1cd64b6774b6042671bd80b1ff061b8f2d6a8f4","observation_id":"01653e1a-8049-494c-a812-9c7320c6e501","resolution":{"observed_at":"2026-08-11T04:17:44.127261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-08-15T14:09:09.630404Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"cited_work":{"arxiv_id":"2605.19436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19436","snapshot_observed_at":"2026-08-11T04:17:44.759376Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","venue":"cs.LG","work_id":"693a35e0-1565-45e1-8ba2-43565ea88dbd","year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.132452Z"},"links":{"cited_paper":"/paper/2605.19436","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:aaa27a8fd4d0e86551892f69c1215e011b1725529409f12efd1315842c1360d4","observation_id":"cc1008c9-cd83-4da0-8597-d3369fc394c9","resolution":{"observed_at":"2026-08-11T04:17:44.764322Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-11T04:17:44.137755Z","title":"Distilling the knowledge in a neural network, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.137755Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:05f8926c99c6feba8aac667f7f5212cda91de58c45400ad3207af6c5abaebc79","observation_id":"b41e6217-f389-4304-81a6-a5c94676d9bd","resolution":{"observed_at":"2026-08-11T04:17:44.137755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.142454Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.142454Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:bcfabe38e65467a8947c4c71d9355773e1a80c89ffd1cb58379804a7569a9d2a","observation_id":"3c49111a-f39d-412c-ade2-2addec5408ec","resolution":{"observed_at":"2026-08-11T04:17:44.142454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-11T04:17:44.147331Z","title":"Reinforcement learning via self-distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.147331Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:9f38c2802f225a56d05c39acf1b00b76e8d5d01e0abd654ccc2e85a03e8a244b","observation_id":"9de25cb6-c398-4287-ad24-2068d9dcdbba","resolution":{"observed_at":"2026-08-11T04:17:44.147331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.152810Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.152810Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:616ad4aaf0050e53f852934255d9d3f7165d76d1ac9ef3dbad9545d609c2e75b","observation_id":"69b91893-6b02-4442-b4ab-e69624456fc7","resolution":{"observed_at":"2026-08-11T04:17:44.152810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T04:17:44.157228Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.157228Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:6da9e8c5c8784ada0ae3e3084d4b7cfe24b60bcf0a666d849b8075d3817992e2","observation_id":"6ea2943f-50cb-4a27-aa55-9a70356eaf12","resolution":{"observed_at":"2026-08-11T04:17:44.157228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.161858Z","title":"MM-Zero: Self-evolving multi-model vision language models from zero data, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.161858Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:475485d7c0e10c2aae0c674c8779e7dadb4725ed73a2b9e2c47383b05f3e4103","observation_id":"4afe182f-1200-4888-a95f-4f39c5a8fb0d","resolution":{"observed_at":"2026-08-11T04:17:44.161858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-08-16T21:45:56.892632Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21924","snapshot_observed_at":"2026-08-11T04:17:44.165871Z","title":"Visual-advantage on-policy distillation for vision-language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.165871Z"},"links":{"cited_paper":"/paper/2605.21924","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:1573d7fd6151487d7bc1ff2d60f17a87cb0a896d8e1ebeaa477b55fe32e09454","observation_id":"b5b85fbf-b64e-4942-b5f0-c960b968d35e","resolution":{"observed_at":"2026-08-11T04:17:44.165871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:45.048215Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision","venue":null,"work_id":"fa4ebb21-7fd8-4319-abf3-0fcd90d750b5","year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.170330Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:99fd20b29ffddb6096606490c306937f6f76abe79b9c6ca3999c9a6e0352969d","observation_id":"706078c6-568e-4c34-9217-0d157d314475","resolution":{"observed_at":"2026-08-11T04:17:45.053778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:45.036347Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12), December 2024","venue":null,"work_id":"a6446717-9535-41c9-a26a-6ce18dede7ba","year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.174470Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:5768e6465b97b580f4ce65c2f95f6958390f3b895563b9c133aae4b34120b68f","observation_id":"a344f4de-710b-48ed-8232-b2b26ba2238a","resolution":{"observed_at":"2026-08-11T04:17:45.040516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.179553Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.179553Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:4904486d1d5276e14c6a72ff5bad104f4df2d9f377c886f7a38f669e15ad7a83","observation_id":"7736c1dd-ce60-41e7-b50a-8a264bae6921","resolution":{"observed_at":"2026-08-11T04:17:44.179553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.183963Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.183963Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:3e2f27c388f761b1e8f66f203b107ece5ab2ec7d7dc3a0cad9b09d0d56cfc101","observation_id":"ce529e7f-a892-4f5e-9b7b-3af3e8aa0250","resolution":{"observed_at":"2026-08-11T04:17:44.183963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:45.009054Z","title":null,"venue":null,"work_id":"601cbc7d-5b4c-48c3-aad9-5756fb34866a","year":2022},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.188690Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:0826e88183f331ca55fed5ab6a3cded47fe1c83a6634fe219245343dfca48f1a","observation_id":"bef55480-7c01-4a8e-b997-1fa6b4a33fb8","resolution":{"observed_at":"2026-08-11T04:17:45.014002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.192669Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.192669Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:d5a4cb3e5023d3fdc369984346076976cfba2ca9f544b55fd852614f8eac0221","observation_id":"07284d10-0b13-4f2c-9923-4fe1077c87b4","resolution":{"observed_at":"2026-08-11T04:17:44.192669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.986938Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":"70f18ca5-185d-43aa-8edf-4603a0364d66","year":2011},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.196313Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:46ca3123ec14603a079a1150c28d77a6d15202e5bc5700ab69541fc9b4452ad3","observation_id":"b9233527-fcde-489f-9072-e20468c0ab45","resolution":{"observed_at":"2026-08-11T04:17:44.992401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T04:17:44.200564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.200564Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:1a85e631822beaff7d5074756a666243f5ecdedd51f06b5fe1f7b6ed11a84ffa","observation_id":"f3415c4b-9aed-4d6b-a6c3-c4406f885d5a","resolution":{"observed_at":"2026-08-11T04:17:44.200564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-11T04:17:44.204392Z","title":"VLM-R1: A stable and generalizable R1-style large vision-language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.204392Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:20c148fd56bf1bb76abc7827a93d2480e5c487e0f8c1d578c96248f8d05ff0fc","observation_id":"fbdbf1c4-2014-4070-a796-b8ef90a1612e","resolution":{"observed_at":"2026-08-11T04:17:44.204392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05877","last_updated":"2026-05-20T07:09:51Z","snapshot_observed_at":"2026-08-17T00:24:16.746311Z","submitted_at":"2026-01-09T15:53:42Z","title":"iReasoner: Trajectory-Aware Intrinsic Reasoning Supervision for Self-Evolving Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05877","snapshot_observed_at":"2026-08-11T04:17:44.208861Z","title":"iReasoner: Trajectory- aware intrinsic reasoning supervision for self-evolving large multimodal models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.208861Z"},"links":{"cited_paper":"/paper/2601.05877","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:1d6b6c428e0d83e88ea62d75d3a5b9432e4a7a52d2fa95ebf6479c2c76dbdd16","observation_id":"72feca84-aa2d-4986-bec3-5b004ca5d1ef","resolution":{"observed_at":"2026-08-11T04:17:44.208861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16672","last_updated":"2026-06-09T22:19:41Z","snapshot_observed_at":"2026-08-15T17:58:47.718751Z","submitted_at":"2025-11-20T18:59:54Z","title":"EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16672","snapshot_observed_at":"2026-08-11T04:17:44.213416Z","title":"EvoLMM: Self-evolving large multimodal models with continuous rewards, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.213416Z"},"links":{"cited_paper":"/paper/2511.16672","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:f98ecac6a58fe5deddd63f00f104b7db4610d99cdde09522528fec932bbd4948","observation_id":"ef8e20ac-bef1-4ef3-92fc-d5d834df0948","resolution":{"observed_at":"2026-08-11T04:17:44.213416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27376","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-08-13T08:13:11.519782Z","submitted_at":"2026-06-25T17:59:57Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","version":1},"cited_work":{"arxiv_id":"2606.27376","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.27376","snapshot_observed_at":"2026-08-11T04:17:44.572974Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","venue":"cs.CV","work_id":"b1acd678-4cc5-4822-a9e2-be44d9a32d1d","year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.218120Z"},"links":{"cited_paper":"/paper/2606.27376","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:d152c8b84241f9d78c1c2fcdd92a333974f5948b25204501b62a7182988c7d79","observation_id":"62df7afa-b1e8-4b9e-a724-3fa77d74b28f","resolution":{"observed_at":"2026-08-11T04:17:44.577412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.222018Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.222018Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:48efdf65cc8464599f07339e3bf68d18a00110ef49fef3848f0df989f4a36c2b","observation_id":"27ce28bc-f464-4c95-ad26-d3b1fccca431","resolution":{"observed_at":"2026-08-11T04:17:44.222018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.965075Z","title":"Paying more attention to visual tokens in self-evolving large multimodal models","venue":null,"work_id":"0df37527-4309-4913-959f-1d4a649081fa","year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.225755Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:98e65d31f725bfd1d83665d1ee84b898c21300fd424213a876749a533a159d1a","observation_id":"22c0bd89-a4a7-4c3e-b24f-bb1932478b05","resolution":{"observed_at":"2026-08-11T04:17:44.970556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.229522Z","title":"Vision-Zero: Scalable VLM self-improvement via strategic gamified self-play, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.229522Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:38c3f1ca73597446b660233d61c58e35f33590dc63beb60d3c776918ba68cf93","observation_id":"7258add1-d78c-4f86-9fca-25162a9e1008","resolution":{"observed_at":"2026-08-11T04:17:44.229522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21289","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.487213Z","title":"When models judge themselves: Unsupervised self-evolution for multimodal reasoning, 2026","venue":null,"work_id":"85add5a2-d829-4a1d-a792-d32f0712b094","year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.233726Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:88bd0253068db3fadc7952348615c3ea746c9b936e6920eb7845c02329b97b0a","observation_id":"dc8dd3ec-c85e-424f-b562-1b6f99920aa0","resolution":{"observed_at":"2026-08-11T04:17:44.495048Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.951595Z","title":"Realworldqa","venue":null,"work_id":"370f24e6-a965-4eb2-9880-41e08fb0bb53","year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.238033Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:ef761e0e3bdf739bbfe90edcd31eb0b1ae58f3cfb597f755097cac5984441e0e","observation_id":"72dad015-8635-4e31-9257-0451d72e240a","resolution":{"observed_at":"2026-08-11T04:17:44.956552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-08-16T08:27:48.541150Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2605.20914","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20914","snapshot_observed_at":"2026-08-11T04:17:44.395362Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","venue":"cs.CV","work_id":"e64c934a-11cc-4be0-80f6-e15c71c916bd","year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.242315Z"},"links":{"cited_paper":"/paper/2605.20914","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:0cb6e10060e4138e1fbf829e6dc8ef9e1fbe2d71d1c8742fac2f8297f7b32047","observation_id":"5c91bc7b-6a14-4e5d-a237-a84c4d75b3a0","resolution":{"observed_at":"2026-08-11T04:17:44.403579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12400","last_updated":"2026-05-29T21:49:52Z","snapshot_observed_at":"2026-08-16T05:04:08.891684Z","submitted_at":"2026-05-12T17:00:53Z","title":"OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12400","snapshot_observed_at":"2026-08-11T04:17:44.247249Z","title":"OGLS-SD: On-policy self-distillation with outcome-guided logit steering for LLM reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.247249Z"},"links":{"cited_paper":"/paper/2605.12400","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:d9a86806274a2dd082929a6d4269e0fcfd1e1db81d2d5f0c5b9d151ca616c3a3","observation_id":"23b8ef9d-c767-4ac4-bfc7-c32e96dfcd55","resolution":{"observed_at":"2026-08-11T04:17:44.247249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-14T06:35:02.186457Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-11T04:17:44.251370Z","title":"R1-ShareVL: Incentivizing reasoning capability of multimodal large language models via Share-GRPO, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.251370Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:c0e13c6d2da1d493e485da1ffc3ecccc3ef12b048e12159ddacab88ea9716fba","observation_id":"639c3775-a925-4144-b8bf-4a3764fe13cd","resolution":{"observed_at":"2026-08-11T04:17:44.251370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-11T04:17:44.255750Z","title":"DAPO: An open-source LLM reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.255750Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:1db7afcbced77579ab0f1e7716af8c4eaddd77ca5f9cec5012f1aef7ba3628bd","observation_id":"cd36e72e-bf56-4a99-933c-dce48774ef01","resolution":{"observed_at":"2026-08-11T04:17:44.255750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-08-15T12:30:13.692111Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18740","snapshot_observed_at":"2026-08-11T04:17:44.259723Z","title":"Vision-OPD: Learning to see fine details for multimodal LLMs via on-policy self-distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.259723Z"},"links":{"cited_paper":"/paper/2605.18740","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:a64caaebe5a8258f9b3c5e06b6fbde5b80b0341b46fdc4ae6c51212f74aaa861","observation_id":"736a200a-4218-455a-a978-591c4b01ac2c","resolution":{"observed_at":"2026-08-11T04:17:44.259723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.264323Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.264323Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:86e54c503c0f9002f2d9b1a8d89aa147280b6dc2c0d7197c06d5a817ecba0b10","observation_id":"5594c7a9-0988-458b-a9d3-06cbc35e7371","resolution":{"observed_at":"2026-08-11T04:17:44.264323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.268126Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.268126Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:b4e09b6c56105b49d44e6b705c9fa9424c02dc88b379becc06ece6808e7b46ba","observation_id":"49f1436c-0382-4bef-bf56-5b4c584e63dd","resolution":{"observed_at":"2026-08-11T04:17:44.268126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.273112Z","title":"R1-VL: Learning to reason with multimodal large language models via step-wise group relative policy optimization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.273112Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:1d59804516bb04d87711ae4a90282705333558aa5c96c18f92baa28e82362aed","observation_id":"c3343f26-59cf-465f-b162-c28ac1924ac2","resolution":{"observed_at":"2026-08-11T04:17:44.273112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:17:44.282830Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.282830Z"},"links":{"citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:a53e8c17b3f10e2a9255b238f757f402998c79192a34d46d9b121f562d4e344d","observation_id":"ed80c698-ea8d-4b35-b1ff-30817ceab881","resolution":{"observed_at":"2026-08-11T04:17:44.282830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-11T04:17:44.287143Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.287143Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:c226a84a261b578a99a0243350d87f96185b955f70c6ee2d58a8762d123a9a18","observation_id":"0dc928d2-923c-4d82-a5f8-9f024a03d796","resolution":{"observed_at":"2026-08-11T04:17:44.287143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-08-13T01:43:27.853141Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-08-11T04:17:44.291837Z","title":"ROSD: Reflective on-policy self-distillation for language model reasoning across domains, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.291837Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:882367aa9a5527d52e45516905478cd76d76c994419dcd69b822745c746c89fb","observation_id":"8bb9a19c-d6a7-4937-976e-735adde98c7f","resolution":{"observed_at":"2026-08-11T04:17:44.291837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T04:17:44.107841Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.107841Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:332b9a7f5a7ad64fd1700dac41525b4685b9cb6cd3541d49636b1a513bebdf88","observation_id":"756a531f-d99c-430d-9d57-cad1e6e2540e","resolution":{"observed_at":"2026-08-11T04:17:44.107841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-11T04:17:44.278544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:44.278544Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2608.09931"},"observation_digest":"sha256:b59e6f5ee1bf8e8b65779185710d6d7926deaf5263881fb39b7aafcdf27239f6","observation_id":"f9102c83-a3ba-4dd7-8c74-3b0eb7023be1","resolution":{"observed_at":"2026-08-11T04:17:44.278544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09931","last_updated":"2026-08-10T17:59:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:54:31.977735Z","submitted_at":"2026-08-10T17:59:56Z","title":"Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.09931."}