{"as_of":"2026-08-22T14:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d0e022b649d60aa6325a2bb027694209b5b2a52b7227b398bcc95093da27582","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:19:57.764281Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.20439/citation-record","integrity":"/paper/2511.20439/integrity","json":"/paper/2511.20439/citation-record.json","paper":"/paper/2511.20439"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T20:19:57.638438Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.638438Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:361dddc0edcc51a8d9e9bed5f05b6aa2365ee2977dd7e67982da6cf909bf665c","observation_id":"7bdb75b9-0d88-489e-adf9-e36e7ed32e77","resolution":{"observed_at":"2026-08-03T20:19:57.638438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.643279Z","title":"Invariant Slot Attention: Object Discovery with Slot- Centric Reference Frames","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.643279Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:37388e7fc9205c3221b6efdc99a3f2900d93e00f1d61ed19ca3d5dadb7bffd27","observation_id":"4f0d3d5d-0777-4283-9fe4-89b8b9592b11","resolution":{"observed_at":"2026-08-03T20:19:57.643279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.647003Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.647003Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:960308e75660bd9987d47858156233806f2989849cc312f9ca8b6e76c1b30412","observation_id":"76d49dd9-2e87-49fb-a2ea-e98103c4d516","resolution":{"observed_at":"2026-08-03T20:19:57.647003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.650849Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.650849Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:58c3001c8634e3d1b57052c6b65e311c4d6b725c80681d0b6d3900dbf313f1a9","observation_id":"a3efce13-acb8-4973-aafb-ba9f97e94bbf","resolution":{"observed_at":"2026-08-03T20:19:57.650849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.654488Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.654488Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:4b7cdcbb2d13b38217ed861d132275bbd4625bb025c758564f4bb714c1398fd0","observation_id":"e8217cb1-0a4a-49f7-9ed5-c678a3b68b78","resolution":{"observed_at":"2026-08-03T20:19:57.654488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.657702Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.657702Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:e32a14ff7d2ea63168374478ffae99d9ed05abae96621a7c64a6ceb88bc665dc","observation_id":"31db8585-1472-4072-b029-37f2c5229368","resolution":{"observed_at":"2026-08-03T20:19:57.657702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.661068Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.661068Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:b438630112ecc01b829be67c8f74355ae980ee5e3370d6e38b99f8f13d1c0c85","observation_id":"609920c9-3a26-4a6e-a95e-ef91aa253854","resolution":{"observed_at":"2026-08-03T20:19:57.661068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.664289Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.664289Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:05a9034a56714c52c506993cb02468a96e03811ca103ad2abfe31a3697a8fe35","observation_id":"663eec7e-fe31-49d6-a943-7b3e1687816f","resolution":{"observed_at":"2026-08-03T20:19:57.664289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.667395Z","title":"Improving Object-centric Learning with Query Optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.667395Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:0e28b9cdfcca2dde4c50351586fa986c79fdad5b32e6f4039f86742af6ab745b","observation_id":"54797207-daea-4a8f-ab57-2a0b46532e1f","resolution":{"observed_at":"2026-08-03T20:19:57.667395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.670107Z","title":"Spot: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive Transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.670107Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:d1ca71d05276c672543d5727fb3e6d0126efdc9f23bafcddd803a901b5b21365","observation_id":"e1d3a1af-e38b-4fa0-9683-b2c3d9861204","resolution":{"observed_at":"2026-08-03T20:19:57.670107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.673071Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.673071Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:13af0e7eeb89c7c6cef30465646720a058eba058792e7480ea8b293c0593c20a","observation_id":"29e27677-42f9-4bd0-a46a-886eb9446861","resolution":{"observed_at":"2026-08-03T20:19:57.673071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-03T20:19:57.675843Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.675843Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:97f7944a28070a81de0c967247d5afb7ef2989577ca08fc829ecb7b0c321bb4b","observation_id":"9f61697f-ab6b-404a-8f56-d7c1bd16f01a","resolution":{"observed_at":"2026-08-03T20:19:57.675843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-03T20:19:57.679008Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.679008Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:e27689a2d501f0428015665dfc030e5e4cf27db02422bb981d171eda0845818f","observation_id":"8648c6b5-3eec-4c1d-ba4a-0156d6f1239a","resolution":{"observed_at":"2026-08-03T20:19:57.679008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.682081Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.682081Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:b34ea516a98d972308e327df83fc727e4e75c28928b8f9071300e8162f3113bd","observation_id":"781f2851-0b89-49b7-af6b-9cdee1c13a93","resolution":{"observed_at":"2026-08-03T20:19:57.682081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.685000Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.685000Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:baaa6488275c855e457e49f92a92f2ee56ce58d25f4c4c58c401094d7f921787","observation_id":"fc242561-69c5-40b5-9219-65e5fd4cfde7","resolution":{"observed_at":"2026-08-03T20:19:57.685000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.687748Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.687748Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:5774e4332c7f3cd67e88a2a69cdacacdc7ac69a040174cc2e492d93e8e5cd77b","observation_id":"d675fbc9-106a-4e70-b47b-0b320e632b6d","resolution":{"observed_at":"2026-08-03T20:19:57.687748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00553","last_updated":"2026-04-20T01:01:28Z","snapshot_observed_at":"2026-08-13T07:03:03.849184Z","submitted_at":"2025-08-01T11:48:11Z","title":"HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00553","snapshot_observed_at":"2026-08-03T20:19:57.690392Z","title":"Hiprune: Training-free visual token pruning via hierarchical attention in vision-language models.arXiv preprint arXiv:2508.00553, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.690392Z"},"links":{"cited_paper":"/paper/2508.00553","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:a8230cddcd482c7be242096ae47b2e76e8e0da1841fd58d250825e0eb7078039","observation_id":"2701cd67-e999-4c85-95a1-d10392917ddd","resolution":{"observed_at":"2026-08-03T20:19:57.690392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.693646Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.693646Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:9e3c83df9869194f2daa1357e9d3360bd8bf510c8a6c079edb892e40940f124e","observation_id":"15fe81ce-0ad1-4070-b11a-0052199e36e1","resolution":{"observed_at":"2026-08-03T20:19:57.693646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.696316Z","title":"Object- centric learning with slot attention.Advances in neural in- formation processing systems, 33:11525–11538, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.696316Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:b3971d527ed174312e8abd2e1e9fa8f8b7f2e7ac8c25a17530c9694330edcf4e","observation_id":"ff3236da-a8f7-46d3-88c0-312359f14136","resolution":{"observed_at":"2026-08-03T20:19:57.696316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.699067Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.699067Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:a35c2c870b152e66e7952b2dc737657c1902f039b27dcca3f970d9d10fb44418","observation_id":"87a856d0-8a55-40b1-ae5f-547db0fc364b","resolution":{"observed_at":"2026-08-03T20:19:57.699067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.702079Z","title":"Temporally consistent object-centric learning by contrasting slots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.702079Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:b046d0a6a0fe04f7c88c98948b38f4df93214be3532a696205cef16268c83eee","observation_id":"44d11a48-ed1b-4212-8026-ed04f7018e8b","resolution":{"observed_at":"2026-08-03T20:19:57.702079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.704723Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.704723Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:76fd5805b24d8e498fff69827f0ad961f106a7320085ed455d7358a0d3b43a2c","observation_id":"cfb0f784-a140-4f1c-9729-15bada9374dd","resolution":{"observed_at":"2026-08-03T20:19:57.704723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.708009Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.708009Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:63d0e780fd635347692e7dd190e708b3411ff49b8d2979d22b6f5bab4455207b","observation_id":"a99ef534-51d8-492f-af74-ebadcf5362c6","resolution":{"observed_at":"2026-08-03T20:19:57.708009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.711377Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.711377Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:22a5e8b1bb93458504be03ee4f138c5a68676a3791ccf2bd084e1615cbe3dac6","observation_id":"bd5e67b3-50e3-4a13-bdc5-4586ec7cc3b9","resolution":{"observed_at":"2026-08-03T20:19:57.711377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.714392Z","title":"Less is more: A sim- ple yet effective token reduction method for efficient multi- modal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.714392Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:e2125ef5d9a864bc83de5e26272de807612390bae6233a34e961c47ac84e1c01","observation_id":"e037fa8f-5851-4b95-ad99-51695ad72b50","resolution":{"observed_at":"2026-08-03T20:19:57.714392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.717592Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.717592Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:fd980e7c53bf9dfbe3bcfc523816818f8766fa71b540ee3955bfd5b2acfa86b9","observation_id":"12614eef-ba43-45c0-a693-6ef5fa328563","resolution":{"observed_at":"2026-08-03T20:19:57.717592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T20:19:57.721567Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.721567Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:eb311e6f3c81c0bd00e003e7ca73cd373b9d0d715910cdcfb2fb8bcb602b3602","observation_id":"8744c380-d06b-41a7-81a0-c22e11551ea8","resolution":{"observed_at":"2026-08-03T20:19:57.721567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.727020Z","title":"SlotDiffusion: Object-Centric Generative Mod- eling with Diffusion Models.Advances in Neural Informa- tion Processing Systems, 36:50932–50958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.727020Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:3ae586e6a1e4cb161f511001297729ff263a74feda41734926e69cbc5afe779e","observation_id":"ad154c0f-9850-42c5-bdce-09a2c25ee2a1","resolution":{"observed_at":"2026-08-03T20:19:57.727020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.731279Z","title":"Conical visual concentration for efficient large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.731279Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:7b7c3387ff70a7d7fa6dd56aa4bcf4d1c26f4d3adb3d601f9e51cfeda7eab594","observation_id":"61340193-c238-4791-8e28-0eb470e7efe9","resolution":{"observed_at":"2026-08-03T20:19:57.731279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.734872Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.734872Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:6e60d6af9f87af3f5b017cdc97426d86819d2df6e601ee702ef00332fa4c8690","observation_id":"c0f215aa-3b7b-4206-b922-b7aaca170ec1","resolution":{"observed_at":"2026-08-03T20:19:57.734872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.738313Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.738313Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:86985cbf715de609df0fb466a6d6e849b445cc2629ea1f2d460e92e4ff0bdd46","observation_id":"501c6f9c-7aad-4093-845b-4ac155d10106","resolution":{"observed_at":"2026-08-03T20:19:57.738313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.741594Z","title":"Object-Centric Learning for Real-World Videos by Pre- dicting Temporal Feature Similarities.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.741594Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:aad9e0279823e331335d127a00ff94aef21a7f7a144a3b70bd02058a3e02cf3f","observation_id":"84f066d8-5d1c-4deb-a718-97079d7bd7df","resolution":{"observed_at":"2026-08-03T20:19:57.741594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.744475Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.744475Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:5d0d3a06b8ca41abbaadcd8a10c311dd4bdc146ae09d828f2db8217b0845b1cb","observation_id":"22b0e0e0-5ed3-4dbe-863b-fbb411463446","resolution":{"observed_at":"2026-08-03T20:19:57.744475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.747622Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.747622Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:0ef68eccdf2f814151a19d36435150bb6daba48152c1af19918795e65aad0416","observation_id":"41fcc725-f991-4930-89b4-fe565ca1e56d","resolution":{"observed_at":"2026-08-03T20:19:57.747622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.751167Z","title":"Predicting video slot attention queries from random slot-feature pairs.arXiv preprint arXiv:2508.22772, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.751167Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:56b39e1340a5c6c03e979399a41c8a762778de965491697cd520a9dcf88469b0","observation_id":"e4d2496a-9011-448c-bea4-4daf8586d8d1","resolution":{"observed_at":"2026-08-03T20:19:57.751167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.754330Z","title":"Vector-Quantized Vision Foundation Model for Object-Centric Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.754330Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:00523f22564e9720fb3f45545e663ca0a1d128dd74fba72783a3e12397e432e2","observation_id":"15f17c84-6894-4ad7-a2af-1e1a4649d094","resolution":{"observed_at":"2026-08-03T20:19:57.754330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05417","last_updated":"2026-05-27T15:27:53Z","snapshot_observed_at":"2026-08-14T01:08:42.324489Z","submitted_at":"2025-08-07T14:09:33Z","title":"Smoothing Slot Attention Iterations and Recurrences","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05417","snapshot_observed_at":"2026-08-03T20:19:57.757841Z","title":"Smoothing Slot Attention Iterations and Recur- rences.arXiv:2508.05417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.757841Z"},"links":{"cited_paper":"/paper/2508.05417","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:9e8beb64ca505ea3483f5a2b8d277030f332662c2f82668c115802b4de4b21ce","observation_id":"66de32da-b792-4fa5-97a9-c7195582385b","resolution":{"observed_at":"2026-08-03T20:19:57.757841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.761323Z","title":"Slot Attention with Re-Initialization and Self-Distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.761323Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:1e7db10ce52ba087c717bba409c04a7d371ac843930669d1ce93ac36d7da3e19","observation_id":"cc776f21-cf19-4a1e-a9fb-260e27c90d8d","resolution":{"observed_at":"2026-08-03T20:19:57.761323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-03T20:19:57.764281Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.764281Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:7801dbe9e9360e55f883d8e11fe681db783fe3698777621ac836d8f8d798a6d3","observation_id":"8dea26c4-5443-416e-9183-a419fbf7c9e1","resolution":{"observed_at":"2026-08-03T20:19:57.764281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T00:49:27.424959Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2511.20439."}