{"as_of":"2026-08-23T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32943647bff3a93d98d4e273a37ad4151130c1858b9b6aa9a1546d8fdc8e33bb","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:18:06.616164Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20842/citation-record","integrity":"/paper/2507.20842/integrity","json":"/paper/2507.20842/citation-record.json","paper":"/paper/2507.20842"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.011411Z","title":"HiRED: Attention-guided token dropping for efficient inference of high-resolution vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.011411Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8bac4f5df65572901ef95b92b69a6080d2678137eaea148c426f643b4ee47430","observation_id":"9bf00e6c-7602-4633-96e4-f9a9d413c4b0","resolution":{"observed_at":"2026-08-06T13:18:00.011411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T13:18:00.053585Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.053585Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:710e3b1879dce475b814cd0e9dad54cf91c4764d7e70fce67500b5a79e7195bf","observation_id":"c1485921-bb5c-4034-9de7-180bcad8880c","resolution":{"observed_at":"2026-08-06T13:18:00.053585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T13:18:00.134131Z","title":"Qwen-VL: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.134131Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:69e192cd3961cc12511933329de6a3d0269c03589ee3eaa9588dd049c188b0a0","observation_id":"87ea521d-1dbc-492e-9cda-e099ef20f5d9","resolution":{"observed_at":"2026-08-06T13:18:00.134131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.225142Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.225142Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:4e1d6c8dacd08326b4912f7fe2f5da278298219a0ebe1b3bc7a0f424cef7f61f","observation_id":"ead1432d-477a-4e49-9bcb-f4c9afa33128","resolution":{"observed_at":"2026-08-06T13:18:00.225142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.280685Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.280685Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:2c3a9edf81deb454fddd8b7cc413083f5cb036d759b6627b701bfe77b4d2ba76","observation_id":"999b5cec-07e7-4562-9256-9980b3894810","resolution":{"observed_at":"2026-08-06T13:18:00.280685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.380288Z","title":"Open-LLaV A-NeXT: An open- source implementation of LLaV A-NeXT series for facilitat- ing the large multi-modal model community","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.380288Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:a1021387ecdbefa2d0244cebcde8a6a5d6cc059ce215e885bfff7e8cf48ed8be","observation_id":"a357e339-40d8-4090-b109-d7355d21abd4","resolution":{"observed_at":"2026-08-06T13:18:00.380288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.860752Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceler- ation for large vision-language models","venue":null,"work_id":"d0ae9100-1a81-4dd2-8e55-0c780011350f","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.452458Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:9fcf0a4c23b2f2292fdaa88237ec791143c9cc84e64437341b4b72641afb1845","observation_id":"31abbaa4-7649-4f69-9f56-0f1ac3899f23","resolution":{"observed_at":"2026-08-06T13:18:08.864395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.849432Z","title":"How far are we to GPT- 4V? Closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":"08d4e00f-7432-4e04-be0e-5c3f9a11d114","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.540214Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:2a655728b0c46802e4390d4bd4f6711b13537f5e03e18d99efb846795534b29d","observation_id":"b63ad6fe-d42f-4d92-8267-c952b4650498","resolution":{"observed_at":"2026-08-06T13:18:08.853260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.838130Z","title":"Intern VL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"b39791ba-3fa8-48a0-87cb-f5e34589de90","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.606313Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:397ffb2246aae8302691e079839b7b919029ca030b68f7d9ddf571043a1ca56e","observation_id":"f1a7e27f-3eba-4793-9aaa-97f459c7bee0","resolution":{"observed_at":"2026-08-06T13:18:08.841852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.825703Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"a6400581-0ad7-4c9c-9781-bc0df607ab70","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.736571Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d1277944efecbc6069d93f7d42d7ca5b2aa97b85553d1b41e07868bae6498431","observation_id":"5f33187f-e21e-4350-9a3b-7088eca57be7","resolution":{"observed_at":"2026-08-06T13:18:08.829581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.813917Z","title":"InstructBLIP: Towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"5999a9f9-15c0-4b66-bb7a-7eb2c932abbb","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.845969Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:a5f4c59972e9a9cdf1230d9b63a6517a903b41100a2dba0a786b410b16b231f8","observation_id":"37646758-eeef-4934-a2ef-29c79e748467","resolution":{"observed_at":"2026-08-06T13:18:08.817783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.802707Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context","venue":null,"work_id":"ae8756f9-1308-4dbe-850b-32fe60d9fd20","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.931596Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:690f8314406fd7fb996ade4651ccc58c55bdac56d2d2920e442cee02b5bdf7b3","observation_id":"0c6b303e-068b-47bf-b7c6-3d6146ff82f1","resolution":{"observed_at":"2026-08-06T13:18:08.806432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.790763Z","title":"Prune spatio-temporal to- kens by semantic-aware temporal accumulation","venue":null,"work_id":"4ec3380c-08e6-4876-b973-2c87ec24cbbe","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.996225Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:3acc3724f6bafd8fac80c7f422214e4c1b13680fd940e035fac21c9b1bf6c5d7","observation_id":"5a9f1c54-b5cd-455c-9b18-fbe011776efb","resolution":{"observed_at":"2026-08-06T13:18:08.794124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17221","last_updated":"2024-01-30T18:09:11Z","snapshot_observed_at":"2026-08-20T22:32:42.215136Z","submitted_at":"2024-01-30T18:09:11Z","title":"MouSi: Poly-Visual-Expert Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17221","snapshot_observed_at":"2026-08-06T13:18:01.081840Z","title":"MouSi: Poly-visual-expert vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.081840Z"},"links":{"cited_paper":"/paper/2401.17221","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8daa83dbebfb7c07b8a383ff0234493b9416a70a068374d1e751faa2fab486d7","observation_id":"7fac3077-35de-432e-899d-6aaaa01bad56","resolution":{"observed_at":"2026-08-06T13:18:01.081840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T13:18:01.159137Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.159137Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:403b0cc3048d0208a548607545d3353e13cb9fc82965cca6fa5d739fa572f141","observation_id":"67d42725-c1e2-4d6e-bd75-eaa9a483f1cd","resolution":{"observed_at":"2026-08-06T13:18:01.159137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.779455Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":"868c6a5c-3600-4b36-ab3a-e875fe8e1df7","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.245744Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:ccbc1f6711d1f489331618cd567b3499fa81d62bd52021798cebb3e8497706f1","observation_id":"88619815-830c-4a39-a3b3-44a8887b3f14","resolution":{"observed_at":"2026-08-06T13:18:08.783034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:01.321659Z","title":"Re- thinking token reduction in MLLMs: Towards a unified paradigm for training-free acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.321659Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:38bfc8de801df386ef07778f80ad9e355c533b1c4b3f483e34a55517dc4df9b7","observation_id":"e7f6c151-3316-4943-9fc6-eb171a65499d","resolution":{"observed_at":"2026-08-06T13:18:01.321659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03105","last_updated":"2024-01-13T15:11:04Z","snapshot_observed_at":"2026-08-16T14:29:30.651079Z","submitted_at":"2024-01-06T02:02:34Z","title":"Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03105","snapshot_observed_at":"2026-08-06T13:18:01.418539Z","title":"In- corporating visual experts to resolve the information loss in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.418539Z"},"links":{"cited_paper":"/paper/2401.03105","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:62f8474bd0621981d65c32d83e56530e28b1ae449a3af5e6c774b6088941c220","observation_id":"b21e7469-2038-42d5-85b6-e5790f74686a","resolution":{"observed_at":"2026-08-06T13:18:01.418539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-08-16T13:10:26.290770Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-06T13:18:01.488615Z","title":"ZipVL: Efficient large vision-language models with dynamic token spar- sification and KV cache compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.488615Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:26a8af05635ec22a87c27269e02a0e521c0aed9e2ec1cc686adea827119ae02a","observation_id":"26d5b24b-0dec-42fb-960f-03fc79cf751c","resolution":{"observed_at":"2026-08-06T13:18:01.488615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:01.597860Z","title":"iLLaV A: An image is worth fewer than 1/3 input tokens in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.597860Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:da932ba62d3e367769d7b2cd957de1b2493964440b9d20a8936b62ba4a3c9341","observation_id":"1bc995b1-b506-4ba3-8c1e-9a3d6fe5ede7","resolution":{"observed_at":"2026-08-06T13:18:01.597860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.769082Z","title":"Matryoshka query Trans- former for large vision-language models","venue":null,"work_id":"16fcec21-4a06-4067-8dcd-6eb81539504c","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.664723Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:b6db21cb166e711dfebf402973bc026ee381e5967bc4c1f7add2585d61c4b827","observation_id":"3898d8c7-9120-4921-a83b-c31e29a5a7e6","resolution":{"observed_at":"2026-08-06T13:18:08.772607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.758331Z","title":"IVTP: Instruction-guided visual token pruning for large vision-language models","venue":null,"work_id":"8b9e4aa8-0e72-4455-b78a-df0de2f016df","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.730301Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:855b9b903d94792d7df1a4d75b54b92d9c4f845adc06e0509ab82992ea46182e","observation_id":"5e583f37-876a-4183-bdcd-00b3f57fe84d","resolution":{"observed_at":"2026-08-06T13:18:08.761920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.747516Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"0cf0c9d7-f730-4014-bf9c-add4b079bdf8","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.830501Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:a70cd54c01f0a1c28d89d506d82d8340704e6114439d48979307cf88433517c8","observation_id":"4842f778-bffd-4c00-becb-7104d57a6a65","resolution":{"observed_at":"2026-08-06T13:18:08.751293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-19T19:01:45.414641Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-06T13:18:01.907280Z","title":"From CLIP to DINO: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.907280Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d5083e21b36f8e98ba4f8e769811fbe8a1d1ad67a8c56b3d37e82b404d092048","observation_id":"31d9f30d-3254-4f1c-8878-c08df639758a","resolution":{"observed_at":"2026-08-06T13:18:01.907280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-13T22:22:43.224763Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14164","snapshot_observed_at":"2026-08-06T13:18:01.973663Z","title":"FoPru: Focal pruning for efficient large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.973663Z"},"links":{"cited_paper":"/paper/2411.14164","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:42a59a6d6ac4986b92c461cd2bd6cae61dcdb97523cafae822dff428a0f9b8aa","observation_id":"41ffb6cd-4e62-4975-bb51-ac4ff2dec3bb","resolution":{"observed_at":"2026-08-06T13:18:01.973663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.736710Z","title":"Devils in middle layers of large vision- language models: Interpreting, detecting and mitigating ob- ject hallucinations via attention lens","venue":null,"work_id":"0312e3af-0790-44e0-9303-7a775e4d9abe","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.040705Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:cf83c886930bdabe19cb179391357ce34162ac79dd3cfa02bbbc082b98a34bbf","observation_id":"76f4f518-fae1-4b0b-b269-393b8a11e5a4","resolution":{"observed_at":"2026-08-06T13:18:08.740474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.726222Z","title":"BRA VE: Broadening the visual encoding of vision-language models","venue":null,"work_id":"0438cf2e-ebd7-4bc6-b222-50275c3a7759","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.136557Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:df499d6622fbccb7bc119b1a623e922b9feba632723e2f1443dd84e5d22ae163","observation_id":"a4427d5e-302e-4b23-ae12-c54ea29f5961","resolution":{"observed_at":"2026-08-06T13:18:08.729482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.715997Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"03020bac-5a1f-4586-922f-4fc8f8636895","year":2016},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.232705Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:cdba71f74ea6ff097ba7f5c774321ccbf403b6a2a652bb9226c45da6b4080049","observation_id":"8dd021e5-ca85-4eb9-b5f1-346cd0c4358e","resolution":{"observed_at":"2026-08-06T13:18:08.719364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.705690Z","title":"MoAI: Mixture of all intelligence for large language and vision models","venue":null,"work_id":"0803c025-65f4-44b5-8297-85e5a4e4c732","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.308242Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:53c79849d4a1dfe5e5ae596b40b4e40a70ccdacdbd866b457458658599be431b","observation_id":"cfcabdef-1f29-4320-ae73-b6344af3bff9","resolution":{"observed_at":"2026-08-06T13:18:08.709154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.694733Z","title":"Pix2Struct: Screenshot parsing as pretraining for visual lan- guage understanding","venue":null,"work_id":"bb9156d6-7807-47a1-abba-4e717289a3c8","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.410969Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8689b6083a4d58bd7a7f54f98c10beb248039faa0af8b2c373c61e1127215065","observation_id":"55b7590d-b294-472b-a4b8-5a07d4faaf0f","resolution":{"observed_at":"2026-08-06T13:18:08.698366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.682184Z","title":"SEED-Bench: Benchmarking multi- modal large language models","venue":null,"work_id":"1c9a75b6-cfc0-4c98-93e8-0d5fe6288098","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.461864Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:7cf8b5167e90a7b3fd39faf432bdbbd95d0fd8bfa1502dc55a2790d3dba8747d","observation_id":"bd6385b9-6310-4559-b82c-97769486e6ed","resolution":{"observed_at":"2026-08-06T13:18:08.686313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-18T18:30:32.501118Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19036","snapshot_observed_at":"2026-08-06T13:18:02.510363Z","title":"RedundancyLens: Revealing and exploiting visual token processing redundancy for efficient decoder-only MLLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.510363Z"},"links":{"cited_paper":"/paper/2501.19036","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:1084fda20bbb025c2890f0245e11b0779ca1e4adee7ef16f6f4ffcbbb2e986a1","observation_id":"a1defa97-b381-48e2-abbd-47a45d5d425d","resolution":{"observed_at":"2026-08-06T13:18:02.510363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.671734Z","title":"TokenPacker: Efficient visual projector for multimodal LLM.International Journal of Computer Vision, pages 1–19, 2025","venue":null,"work_id":"e8808093-5140-404d-b0ce-3b4f1a182995","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.584449Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d7f4f13e9f925692ef215305bb9a82e6d78335d3085dda7a8395d19e7033c5e6","observation_id":"040ac8eb-4830-45eb-bd0d-516ac390e385","resolution":{"observed_at":"2026-08-06T13:18:08.675355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.661375Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"e728385c-f3cb-4893-a237-7862d892195e","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.667810Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:395e24802860f9f032c621abede9677621e4b49cbe7c6ba326a17d3c57bd9899","observation_id":"41ad1dc6-0ca1-4e89-b11a-e48559200bef","resolution":{"observed_at":"2026-08-06T13:18:08.664717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T13:18:02.711071Z","title":"Mini-Gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.711071Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:ac5dbcb17b5a6c8f197115dfdc06e1180d346de858c9f5e48121532a6bb86fb6","observation_id":"cdad8285-6e6f-4c2a-9e95-6cca04aac393","resolution":{"observed_at":"2026-08-06T13:18:02.711071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.650243Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"002b4b10-edd4-4b5b-8ff0-8ebb692a2eec","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.795267Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:2d600b188ec521494c7bd6d82f30620b1344f91000da24e110a8189b0a942e99","observation_id":"3b6694fd-4a77-40fe-9369-c16178c0e4f6","resolution":{"observed_at":"2026-08-06T13:18:08.654102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.640291Z","title":"HRank: Filter pruning using high-rank feature map","venue":null,"work_id":"ffe5ea3f-5c7b-4a0a-8ff6-2e82c07a5fac","year":2020},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.859823Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:40cffa03dd65d8d6f201febb572106fd1c3bafe6f59ca370fd6cd9f5dbd1eb01","observation_id":"62166a73-9f04-4031-9caf-5f17fd56f6d5","resolution":{"observed_at":"2026-08-06T13:18:08.643503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.630311Z","title":"SPHINX: A mixer of weights, visual em- beddings and image scales for multi-modal large language models","venue":null,"work_id":"c26aab82-bfec-470f-8954-3033b4943b64","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.925986Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:527f5215b2a793dacdc0acf80fa1f9f63f339fc77f8255266fdcd78f40b22cef","observation_id":"6d34a01d-7111-4e9d-97c4-c004e9b98230","resolution":{"observed_at":"2026-08-06T13:18:08.633793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.620031Z","title":"Boosting multimodal large language models with visual to- kens withdrawal for rapid inference","venue":null,"work_id":"24688161-746f-4c94-addd-6db9b28d2d4a","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.013426Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:343c6a363d229d1439cbb99fd13bbc5256359efa0bf1a7add11b6d53f1a4ae69","observation_id":"c7edf160-0946-44c9-beb1-fab7aefc1333","resolution":{"observed_at":"2026-08-06T13:18:08.623493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.609424Z","title":"Visual instruction tuning","venue":null,"work_id":"14afc57c-7e67-4e53-80c1-919d62388004","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.129577Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d51c74e364ba19fd707103bef869fe5528c6e7e3983a8f60a15f468e1a107f0c","observation_id":"8ee48e26-ab84-46ec-8f53-0fbd3e941446","resolution":{"observed_at":"2026-08-06T13:18:08.612633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.598231Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"c57fa73b-d762-4c6c-a46b-7466512a22a6","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.211066Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:f24ac7a39afba6c83c7894ce476cc7cdca1479ccb8b3e40a3e86d95c8227d04a","observation_id":"ca253b1e-7681-4ec9-9b34-a803633737dd","resolution":{"observed_at":"2026-08-06T13:18:08.601485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.588183Z","title":"LLaV A-NeXT: Im- proved reasoning, OCR, and world knowledge","venue":null,"work_id":"6c0da18d-1019-42db-a6bd-6310e46780f2","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.273922Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:e9abdafb031363a17bd2765d2befb80e88a371ad9750a0d2e2c508096ec333c0","observation_id":"abbbc795-999e-4f68-8531-01db123ee236","resolution":{"observed_at":"2026-08-06T13:18:08.591311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.578367Z","title":"Prismer: A vision-language model with multi-task experts","venue":null,"work_id":"48532615-ee04-45a8-bd96-8fc0ccedfb4e","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.360116Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:9951b3d292037d62a41dbfd2811235e8364592d6f8f0150d558cd21f9f09232b","observation_id":"b5ddd117-2279-42ae-a3d2-fd28eafd8d09","resolution":{"observed_at":"2026-08-06T13:18:08.581568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-18T09:00:36.136914Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T13:18:03.452277Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.452277Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:c4130913a6673720c20b6b6fbc3568b92b9c640ad6bc7c7a596aeb3cacc11a4f","observation_id":"d0eca418-d976-4faa-adc6-75a5568b58d2","resolution":{"observed_at":"2026-08-06T13:18:03.452277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-06T13:18:03.510688Z","title":"On the hidden mystery of OCR in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.510688Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:53a2ec7d190c41d1ab2339c82aeeca55020df9edb235e674092bfda4e67ac73a","observation_id":"bce14f18-8693-40b5-a6be-ebd619080353","resolution":{"observed_at":"2026-08-06T13:18:03.510688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.566951Z","title":"MMBench: Is your multi-modal model an all-around player? In Proceedings of the 18th European Conference on Computer Vision (ECCV), pages 216–233, 2024","venue":null,"work_id":"2c41df31-fabd-4ce7-a1f0-d860fef080be","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.599690Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:2a7011622b6f94174453ab7a14d4df34a0add51641089e58ba10dd8239265f50","observation_id":"480f02da-cf24-4459-a1fe-aa3824c592b7","resolution":{"observed_at":"2026-08-06T13:18:08.570794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.556530Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"aeb927ba-d1b3-49d3-9045-527706cb8131","year":2022},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.700886Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:ea5d6d3d633131c0973d13d103862131e8c22dd16b13ef9b7450b05d0f12a703","observation_id":"cee4870b-154d-4b25-95d9-b48a0270594a","resolution":{"observed_at":"2026-08-06T13:18:08.559619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-06T13:18:03.786752Z","title":"DeepSeek-VL: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.786752Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:68d53d02db4137beb4b693336e6d64eab50488fb4ef3dcf95a1139b609e7002b","observation_id":"ace58567-937f-457f-bebb-715a9d7d50e2","resolution":{"observed_at":"2026-08-06T13:18:03.786752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.545834Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"534ee5d9-19ca-4a8e-8b64-f307169286f8","year":2022},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.851817Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:50ec5384787873a3aecf4cf67a5832cfc876222230811da01f120c21fc085a24","observation_id":"ae65ec97-940f-4ab8-b051-589240f5ab3f","resolution":{"observed_at":"2026-08-06T13:18:08.549553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.535574Z","title":"Feast your eyes: Mixture- of-resolution adaptation for multimodal large language mod- els","venue":null,"work_id":"0277dfc0-a267-4aee-92ea-825fa03a5be6","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.912455Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:71f15f47f386ebc36fc18e2ac78f2b59207f56280bac2cf3f11fd27f9fed52bb","observation_id":"2c83b4ec-4b18-47d4-b38c-59f88bd7146e","resolution":{"observed_at":"2026-08-06T13:18:08.539139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.524028Z","title":"OK-VQA: A visual question answer- ing benchmark requiring external knowledge","venue":null,"work_id":"20db7033-33d6-4ec7-aceb-1403aea1ce9c","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.967417Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:28aab0079b64a434c43121b52747e49c6cd51ac0bff8682ca0207c734422949e","observation_id":"70a081ae-ac1b-43fa-8d46-07caadfed91d","resolution":{"observed_at":"2026-08-06T13:18:08.527940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.511495Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"51f2b47c-7c3e-476b-9a49-6120ca8edd78","year":2022},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.032069Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:358a49a8f73de309617680d5eef2fde926fe08fdcb9017df8cac5366af703be5","observation_id":"0937d56c-abf6-49c9-85fb-0718abffb9c1","resolution":{"observed_at":"2026-08-06T13:18:08.515372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.500830Z","title":"DocVQA: A dataset for VQA on document images","venue":null,"work_id":"69855508-51a1-4b54-8438-81a772fce865","year":2021},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.097524Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8022d473eedbfe3125b0fe51975085fbb6152b290cf55f4378857feff7f5d6b7","observation_id":"7ab13193-4dec-45a0-a24b-f1aebadadae2","resolution":{"observed_at":"2026-08-06T13:18:08.504388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.490316Z","title":"MM1: methods, analysis and insights from multimodal LLM pre- training","venue":null,"work_id":"ebda0041-1338-4b27-bb12-2d94ab952603","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.196959Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:aae6b6b3f21aaa96452d1d877cef11b7a37770f94cff2a2a7d6aff2d65fa4091","observation_id":"5066e26c-01aa-49ca-a91f-0f801504a090","resolution":{"observed_at":"2026-08-06T13:18:08.493930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.479187Z","title":"DeepStack: Deeply stacking visual tokens is surprisingly simple and ef- fective for LMMs","venue":null,"work_id":"25b4d71a-db42-4067-99f4-0fd179ba7786","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.251891Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:6ad939e4d635285465b4c8c04b1801f8f1be27182c6bba7aad1ccc41fc363e8d","observation_id":"6da9200c-4623-4c24-bd9c-bdd68b00b26d","resolution":{"observed_at":"2026-08-06T13:18:08.482988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.467592Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a9418e26-217b-471d-911c-71f6c19221ca","year":2021},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.341414Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:adccc619db8ceff10a32eabbee757ffae739b5e7c6aa70b29f59f01b8ac73770","observation_id":"1181e175-b624-4b44-8bda-bc0c2878e5cf","resolution":{"observed_at":"2026-08-06T13:18:08.471349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:04.431699Z","title":"LLaV A-PruMerge: Adaptive token reduc- tion for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.431699Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:04a0b1170f145fe015e5f3987c6080f4ba1730a76ccdb1a9efba61a773d386d7","observation_id":"6ae5eacd-d64e-4b0a-8573-1e8e45d967d9","resolution":{"observed_at":"2026-08-06T13:18:04.431699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.457353Z","title":"Eagle: Exploring the design space for multimodal LLMs with mixture of encoders","venue":null,"work_id":"a8c01d1a-4d22-4999-9721-b61fbaebbad0","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.492453Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:3d350638add616d3d25b5041d534ef8e7aaa6d98a4453635df2a9e6fe1cff995","observation_id":"3e60f03f-2a83-4af4-a291-5bbf33ee083f","resolution":{"observed_at":"2026-08-06T13:18:08.460870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.447026Z","title":"Towards VQA models that can read","venue":null,"work_id":"ab93ee8d-94ea-4b5f-900b-beff7b00b584","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.591655Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:02c022fd7d55e3c8ac0860c1d8095dc0f6e2da2d318fb1cd1f115896e418fab6","observation_id":"e706f53b-662e-4af2-abf9-bae93973a430","resolution":{"observed_at":"2026-08-06T13:18:08.450379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T13:18:04.652268Z","title":"EV A-CLIP: Improved training techniques for CLIP at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.652268Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:0fd0d4a673f559b6e865c5d3d3dd16dd9356249a8047edb51dbd885c7167a93d","observation_id":"b0249041-ae47-478a-8c72-4f287eb73c4a","resolution":{"observed_at":"2026-08-06T13:18:04.652268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.435155Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs","venue":null,"work_id":"27003681-76f4-4a92-b851-ae9ade60c4d8","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.720209Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:58c14ccbe13556bd9383516b68a009abb05301315f77606230dc7e7d887d26c2","observation_id":"e013054e-98ce-486e-8c52-63808d777c61","resolution":{"observed_at":"2026-08-06T13:18:08.438994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.423825Z","title":"Eyes wide shut? exploring the vi- sual shortcomings of multimodal LLMs","venue":null,"work_id":"a6d927a3-883a-4761-9b1a-fcd22e1baa56","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.803313Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:91f1dd04615513e24c513af86d797e8ab0572a48aa38251d18485de60d3de10a","observation_id":"fb96b329-82b9-4b0c-965c-452cf3350ee7","resolution":{"observed_at":"2026-08-06T13:18:08.427427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T13:18:04.867176Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.867176Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:10646872f07a6954340c9d8180e4557e04148c45f2cb8508f4599a79ee48756a","observation_id":"282b5c52-48b4-4e8c-881e-9ce32466a1d7","resolution":{"observed_at":"2026-08-06T13:18:04.867176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-14T23:05:28.608576Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-06T13:18:04.956498Z","title":"[CLS] token tells everything needed for training-free efficient MLLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.956498Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:b76a02f726f23ce322cae8e83fd3cdd3202580d97d98610be82c895218df7e2e","observation_id":"e9cfad62-f673-4087-bdbf-bcec45303e3c","resolution":{"observed_at":"2026-08-06T13:18:04.956498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02430","last_updated":"2025-04-10T12:10:28Z","snapshot_observed_at":"2026-08-16T12:59:43.475932Z","submitted_at":"2025-01-05T03:28:45Z","title":"FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02430","snapshot_observed_at":"2026-08-06T13:18:05.021161Z","title":"FOLDER: Accelerat- ing multi-modal large language models with enhanced per- formance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.021161Z"},"links":{"cited_paper":"/paper/2501.02430","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8e3b95ec3e28136610856eec443cb45906a8159c72f7a787c1231c5c69276672","observation_id":"d91cfad3-cda2-4078-8ccc-637e3f969956","resolution":{"observed_at":"2026-08-06T13:18:05.021161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.413134Z","title":"Vary: Scaling up the vision vocabulary for large vision-language model","venue":null,"work_id":"d2f64049-0728-492d-aa0b-e810de9ccd45","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.079387Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:374cf9a9dfa8fe221caa0ad90f358711bdc5208af5a23f781f5b7a036aa4d604","observation_id":"9a0cabfe-691d-4cfa-8656-f7ba10c3efb5","resolution":{"observed_at":"2026-08-06T13:18:08.416656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-06T13:18:05.173548Z","title":"PyramidDrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.173548Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8ba3fd6576d8ed2b3e51c6c1f69ffc8c8d2f39f47339adb831dfaf037e602d81","observation_id":"8e692868-cfec-4a7c-88a0-1d30e254f151","resolution":{"observed_at":"2026-08-06T13:18:05.173548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.402435Z","title":"Mitigat- ing hallucination in large vision-language models via mod- ular attribution and intervention","venue":null,"work_id":"c73fd495-5278-44c0-b4f1-c430399c988e","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.264656Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:b6f25cb8fad884ebf773799b09522728be12e88f02cff321751c25d5539f36f7","observation_id":"5d4cf09f-6e98-4990-a85f-6589f2c41054","resolution":{"observed_at":"2026-08-06T13:18:08.406074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-21T16:35:41.317806Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T13:18:05.305866Z","title":"DeCo: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.305866Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:818568a18d98ddf8de90a7139f62584abfd300813dcf0450da46833d4c8b8b73","observation_id":"77bc4401-8c03-49ac-8110-7207b35e9308","resolution":{"observed_at":"2026-08-06T13:18:05.305866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.390789Z","title":"mPLUG- Owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"329fa329-880b-48b8-b2c1-b3daf80d81cb","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.361829Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:21d678a386e64e67d6c4dbb7afc7bcfbbfdd548def87bd94a8b4a66bb3015877","observation_id":"d637267a-2472-4098-a01c-724fea3ddf31","resolution":{"observed_at":"2026-08-06T13:18:08.395012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.379727Z","title":"Fit and prune: Fast and training-free visual token pruning for multi- modal large language models","venue":null,"work_id":"9bbf98fb-2b36-48e3-9d7f-bc7e3b484675","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.459651Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:b3a30642404c5d6dcd678aae1a8ac4c36f10adcd924c59d0a6f3ea16405faeba","observation_id":"4331c16f-9315-4166-b6d1-784332056de9","resolution":{"observed_at":"2026-08-06T13:18:08.383458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.367738Z","title":"ATP-LLaV A: Adaptive token pruning for large vision language models","venue":null,"work_id":"040c90d3-171e-4a80-a43d-f11292c23b3f","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.553886Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:feab4e3eae4fd5fa684586260d572ff85d117fcf1dbfae44dfc0db560e248dcc","observation_id":"adce2a7b-2be5-4439-a3e7-a01e4d4d0829","resolution":{"observed_at":"2026-08-06T13:18:08.372227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.287951Z","title":"V oCo-LLaMA: Towards vision compression with large language models","venue":null,"work_id":"f3890aec-b7b3-40c2-a776-ee9264544d66","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.613592Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:aafdeaedaf72387f7ced92f2017256cada31a1935745785e63ecdc0d8b8be4a7","observation_id":"37c35d01-b84b-4c1d-a36b-98c03346ace0","resolution":{"observed_at":"2026-08-06T13:18:08.342800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.066955Z","title":"Lifting the veil on visual information flow in MLLMs: Unlocking pathways to faster inference","venue":null,"work_id":"7eca7026-941b-4048-a0c0-cf68382f6a07","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.707052Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8467c0efe4b47758ce2b9c402f6c479dcfa49099c6f119435faa75dc70d155fd","observation_id":"841174f8-18ae-47fb-be48-393b559fb4a1","resolution":{"observed_at":"2026-08-06T13:18:08.184101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-17T07:14:12.508584Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-06T13:18:05.802359Z","title":"[CLS] attention is all you need for training-free visual token pruning: Make VLM inference faster","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.802359Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:355f4b833d80e7fe933548071bcf174fc1e41920fbb666d8a2e0b1dd3eeef74e","observation_id":"18328f71-a4db-42db-a401-0e22267c7c09","resolution":{"observed_at":"2026-08-06T13:18:05.802359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:07.855805Z","title":"LLaV A-Mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":"87badccc-ce4f-4052-8eda-4cd79f67ab37","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.877868Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:6209a9fad187ff66e5d0a4cb4c4bdc83d8253a3115fa8e238130c0dc8477e476","observation_id":"20c3e7d9-921a-4bb0-8a53-73fcbf1558ff","resolution":{"observed_at":"2026-08-06T13:18:07.952000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-18T12:56:24.009168Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-06T13:18:05.927482Z","title":"Seeing clearly by layer two: Enhancing attention heads to alleviate hallucination in LVLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.927482Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:9f563f0f29a7da1182ca6d063ad45692345d2b6556e0b449420637adaf5d350e","observation_id":"bacc4ae4-e3ee-494c-9aba-71a237fc9cf9","resolution":{"observed_at":"2026-08-06T13:18:05.927482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:07.690909Z","title":"SparseVLM: Visual token sparsification for efficient vision- language model inference","venue":null,"work_id":"c3db20bd-5dfb-41af-99f7-624cdb1efa20","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.027505Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:f1108d6a5c83ea8c950cbc93228f8a3b1377b5035c23d7685518f302ca6bbef3","observation_id":"6c1df209-b7b8-4371-b01c-df36f4f61cc0","resolution":{"observed_at":"2026-08-06T13:18:07.783244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06169","last_updated":"2024-11-30T05:32:51Z","snapshot_observed_at":"2026-08-18T10:00:04.391461Z","submitted_at":"2024-10-08T16:13:24Z","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06169","snapshot_observed_at":"2026-08-06T13:18:06.117105Z","title":"Treat visual tokens as text? but your MLLM only needs fewer efforts to see","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.117105Z"},"links":{"cited_paper":"/paper/2410.06169","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:b26922f3e6043a8356d32797108ece1350925d4691ae13a6f85a26460b1a71f3","observation_id":"342ec6a2-1905-450e-b7f2-2146ea7721b6","resolution":{"observed_at":"2026-08-06T13:18:06.117105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-08-18T03:51:17.029774Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"cited_work":{"arxiv_id":"2412.00556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00556","snapshot_observed_at":"2026-08-06T13:18:06.796995Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","venue":"cs.CV","work_id":"5af86bac-23dd-4312-96e6-4d493afa70b0","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.236925Z"},"links":{"cited_paper":"/paper/2412.00556","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:57ec573c088ba163d797ed14b74610ed54e54503a554fb72b506f9a2b5eaf43d","observation_id":"3ceeb469-71fe-446b-85ce-77e1fbf36a68","resolution":{"observed_at":"2026-08-06T13:18:06.881928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-20T16:31:45.393157Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-06T13:18:06.370053Z","title":"AIM: Adaptive inference of multi-modal LLMs via token merging and pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.370053Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:594c4eaf1939ea646730c356f1435654dbdfb58e297b811bb31fa17a6c5c761c","observation_id":"7d65a803-0200-4e6b-aa91-044e0e65175b","resolution":{"observed_at":"2026-08-06T13:18:06.370053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T13:18:06.501322Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.501322Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:f3e84de4245186692b2dde55ece4fb72cdc0112d4aa3db94f3512bba813476b6","observation_id":"b3bbd1c0-7f4e-49bb-aaaa-2dae09d258cf","resolution":{"observed_at":"2026-08-06T13:18:06.501322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-08-21T00:00:43.891067Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14228","snapshot_observed_at":"2026-08-06T13:18:06.528428Z","title":"FocusLLaV A: A coarse-to-fine approach for effi- cient and effective visual token compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.528428Z"},"links":{"cited_paper":"/paper/2411.14228","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:7c0b0a87d3b5e4ed212dd4009abbf2800361d62ee97f65937688eb0fa68e2907","observation_id":"01988274-4b3b-42ef-bd1b-1caf36fbd444","resolution":{"observed_at":"2026-08-06T13:18:06.528428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:07.542682Z","title":"MoV A: Adapting mixture of vision experts to multimodal context","venue":null,"work_id":"2f364566-7fdb-48e7-b6ac-412bf2929ad5","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.616164Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:879026cbf596a2b9d1417af61601423c6d4acfbe06ed5e0a51044c3f7b38c4f6","observation_id":"f050d5af-14cf-4662-9620-6bcb4201c868","resolution":{"observed_at":"2026-08-06T13:18:07.614354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":51},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2507.20842."}