{"as_of":"2026-08-09T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef8fad78e45e0e3c32a71de0292d74cd19e7425aceb2787377e469e1ca04b1a8","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T21:39:21.861654Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:01.186306Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T19:48:11.380911Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19036","snapshot_observed_at":"2026-08-06T18:03:01.186306Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.186306Z"},"links":{"cited_paper":"/paper/2501.19036","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b85465d56a752ac1ad56608965a713c19f68ee8c0fbbea36eb52c9e2b6ad1241","observation_id":"58936284-d05d-4d50-9943-35cc6971894e","resolution":{"observed_at":"2026-08-06T18:03:01.186306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19036","snapshot_observed_at":"2026-08-06T13:18:02.510363Z","title":"RedundancyLens: Revealing and exploiting visual token processing redundancy for efficient decoder-only MLLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.510363Z"},"links":{"cited_paper":"/paper/2501.19036","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:caa049c693c9467e9f7e058ba589536dc1a65f0ff11c087f66ff1b0b82a41125","observation_id":"a1defa97-b381-48e2-abbd-47a45d5d425d","resolution":{"observed_at":"2026-08-06T13:18:02.510363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"cited_work":{"arxiv_id":"2501.19036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19036","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond token compression: A training-free reduction framework for efficient visual pro- cessing in mllms","venue":null,"work_id":"d520330c-4706-4ea9-a722-517de4b614de","year":2025},"citing_paper":{"arxiv_id":"2604.02689","last_updated":"2026-04-03T03:32:55Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T03:32:55Z","title":"Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:33.950587Z"},"links":{"cited_paper":"/paper/2501.19036","citing_paper":"/paper/2604.02689"},"observation_digest":"sha256:fe1b529f85f338bd3cc63a6706d1eb5b9eae04fd89bef3f50f22947f59268677","observation_id":"0a3f0be8-4038-4198-babd-117a6477a653","resolution":{"observed_at":"2026-05-13T19:48:11.382448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.19036/citation-record","integrity":"/paper/2501.19036/integrity","json":"/paper/2501.19036/citation-record.json","paper":"/paper/2501.19036"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:21.594738Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.594738Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:383843aa99b2b110a0d4d406fcdc9eaedd9bce2b3045142006ceec4484aa87dd","observation_id":"222ea20d-5bed-4f91-ac7a-2818be6e5d5c","resolution":{"observed_at":"2026-08-09T21:39:21.594738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:21.600420Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.600420Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:d845fdc17626b786a7a23912cd4dff3021d796d6665f8246297384e7f2d76389","observation_id":"3c35d43a-5902-4d3c-b109-f298906454de","resolution":{"observed_at":"2026-08-09T21:39:21.600420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.883984Z","title":null,"venue":null,"work_id":"af7d3add-e60d-4382-858b-da46fe019573","year":2022},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.605830Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:90aab645bed79751a6dd3364dd880280dc673a8bdc1183d24858cad81871bfb4","observation_id":"a3d53ece-7c89-4d3f-ad24-5edcfff3ae1a","resolution":{"observed_at":"2026-08-09T21:39:22.888534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-09T21:39:21.610540Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.610540Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:9dd0a56d823adb2eeee4df2f5bdb3ce950c76ef6e0443fd83729685dd245d3a3","observation_id":"dc10cd2e-a6d5-43d5-b44d-345cf927049f","resolution":{"observed_at":"2026-08-09T21:39:21.610540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.870055Z","title":null,"venue":null,"work_id":"1facda5f-8b0d-4309-846b-4686ba4464e6","year":2020},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.615711Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:91f3f2d4a2537d18f48764ac17d1c87e9f0f087ee1bc2b238aed84d4d14d244c","observation_id":"fc84dbf1-6106-411e-8a4a-02d046500bbd","resolution":{"observed_at":"2026-08-09T21:39:22.874634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06742","last_updated":"2024-04-01T03:00:06Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T18:59:06Z","title":"Honeybee: Locality-enhanced Projector for Multimodal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06742","snapshot_observed_at":"2026-08-09T21:39:21.620447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.620447Z"},"links":{"cited_paper":"/paper/2312.06742","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:7c7c1edab4b6d35ce8a826c4fed57f7c4971874b3ed060f1db117c938ff1f2a5","observation_id":"ca3ca5c8-7e53-46b0-be24-42e7e55a3e61","resolution":{"observed_at":"2026-08-09T21:39:21.620447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-09T21:39:21.625551Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.625551Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:8f7efc6b626f92aee687788b6a91aa2a2c335d6e7bf04c5f62fecebe9b8fc277","observation_id":"077d4ead-ccc3-41fa-9f43-9f3eeb15daba","resolution":{"observed_at":"2026-08-09T21:39:21.625551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-09T21:39:21.630533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.630533Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:bb75142d07e7e9b057217f392e7936ddecdb5e5b4d12dd46df524cc95531e266","observation_id":"bd44a04c-86c7-44f6-a822-f14fb55347d5","resolution":{"observed_at":"2026-08-09T21:39:21.630533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.854285Z","title":null,"venue":null,"work_id":"84fddd4a-3052-4bd0-a8ac-b234cc52bdad","year":2025},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.636011Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:d73da1dc72ed9d999116d51cce3a808b1d99be682b90b49fd110aa2932d64aae","observation_id":"215cdbb7-72a1-49d4-9395-b0523370df17","resolution":{"observed_at":"2026-08-09T21:39:22.859880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-09T21:39:21.640784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.640784Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:ed28a12bbc2b28b342dc9cbfa691ed3f176583ddfb0ca66471ea75d39185e269","observation_id":"8766b507-a8a1-4cfc-bdb9-841312557341","resolution":{"observed_at":"2026-08-09T21:39:21.640784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-09T21:39:21.645567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.645567Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:02b1846d011e8bef1b117e2289f89c458d77e8019be4b5568a488d1e24567dd2","observation_id":"3316b658-e3d9-4c2f-ad8b-e26eed8ef1e5","resolution":{"observed_at":"2026-08-09T21:39:21.645567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.840486Z","title":null,"venue":null,"work_id":"75d3bcf2-9577-46f2-b8de-786e43c5132a","year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.650396Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:16ae132ce33e57bd87430fb9e78c765682ac2c33bc3c499292c76ff056a8c905","observation_id":"a6332ece-49de-468c-911d-650a0a05bce6","resolution":{"observed_at":"2026-08-09T21:39:22.844867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-09T21:39:21.655000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.655000Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:696381daa745a0a02963c12dc3458fcb0e2e718f8b94f073c56376309538ce0a","observation_id":"2741abf0-0153-4bb6-b11d-fb990c6f6022","resolution":{"observed_at":"2026-08-09T21:39:21.655000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.826970Z","title":null,"venue":null,"work_id":"70058820-d432-4489-9aee-4824f595b1c8","year":2023},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.659804Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:17adea81f45ee5168f61e4151587a75bdef6183cef7e3c25cfffb7a2cd3f2504","observation_id":"2174a1bc-c5ba-4299-aaab-6013ab08f594","resolution":{"observed_at":"2026-08-09T21:39:22.831353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-09T21:39:21.664380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.664380Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:ea78c315a4a2cdb512d98fa7faa8df866315cc22031e539dabdf8457acfee756","observation_id":"7de5c3ec-827c-4522-a171-be12207d8278","resolution":{"observed_at":"2026-08-09T21:39:21.664380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.811743Z","title":null,"venue":null,"work_id":"24f803a9-21d6-4a81-9d6c-9471f42120da","year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.669334Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:c62e5c72ac168918f123948f3dbb2f3fefa4165564d2256df0d1010efbe11c05","observation_id":"887fbce0-fff0-4376-b56c-d62e7a8b2f03","resolution":{"observed_at":"2026-08-09T21:39:22.817100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-09T21:39:21.673873Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.673873Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:ce3c58632fc92403b25d84f860b423f3a4892506406990a8732204fa95801ef5","observation_id":"6b3084b6-0e01-438c-9225-8b44ceab7b43","resolution":{"observed_at":"2026-08-09T21:39:21.673873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.798017Z","title":null,"venue":null,"work_id":"7e4742e8-9c8b-49d9-a49e-ed439292c920","year":2017},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.679248Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:ebcb21860faf058b8484f8f58a8186708896080d7dd879c04a68e07dc1eeb31d","observation_id":"cfc2897f-05b8-4284-be91-6c7857f74d71","resolution":{"observed_at":"2026-08-09T21:39:22.802353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.783702Z","title":null,"venue":null,"work_id":"88ba53d5-5fb5-4e1a-a576-5bb51e993067","year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.683986Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:48ae73889d0eae03423c07a9e5470f7568341455a06c5f004bb6725806689d7c","observation_id":"8cb16a2f-43e5-403f-ae05-be68372db9e9","resolution":{"observed_at":"2026-08-09T21:39:22.788815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.769739Z","title":null,"venue":null,"work_id":"71171c88-8222-4fb5-b8bb-c6c37a29f1c1","year":2025},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.688518Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:cbcf5d1c6023d1e24bd686768eaed556eabc030696433405fbc1d2785a644f4f","observation_id":"a9fa66db-bd1a-44e2-9ead-887ff5a80c2e","resolution":{"observed_at":"2026-08-09T21:39:22.774328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-07-06T19:31:40.352383Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-09T21:39:21.692800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.692800Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:a9f33c960da122c3e332d8b016e2a5aa9154a838aa228fdd36c141f68c1a61b8","observation_id":"237ec53f-4b41-4e22-a08c-21165a974fdb","resolution":{"observed_at":"2026-08-09T21:39:21.692800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-09T21:39:21.697649Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.697649Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:6665c32745a579ef2eff89e00a8463dc20baaf474fbcf9a9edff14b64f33c1f2","observation_id":"41854b49-82df-4c20-af01-61df17409811","resolution":{"observed_at":"2026-08-09T21:39:21.697649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-09T21:39:21.702360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.702360Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:f91e8a3414599ba99c0d94ac9e155ce0265c00ebcfd6ce90f229a5572b21e599","observation_id":"87caebc6-9a09-42e7-85d4-f1a68256f4f8","resolution":{"observed_at":"2026-08-09T21:39:21.702360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02034","last_updated":"2024-10-28T07:40:49Z","snapshot_observed_at":"2026-07-06T18:56:40.234434Z","submitted_at":"2024-08-04T13:55:58Z","title":"Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02034","snapshot_observed_at":"2026-08-09T21:39:21.707003Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.707003Z"},"links":{"cited_paper":"/paper/2408.02034","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:1f6a45d0a2c2e51c21f003c64b11543347697141c9e5e5be1bc9cb6181ecbda1","observation_id":"7828f2ba-fc4f-4316-ac5e-3fb15c75e4c4","resolution":{"observed_at":"2026-08-09T21:39:21.707003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T21:39:21.712002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.712002Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:0c35e0aa9e5cdf9fd8a5a59d260419e4aac3efae9b6a245d511d071fa0445ada","observation_id":"a6dbdbe5-26c2-4a7e-8986-ed95ddb263f6","resolution":{"observed_at":"2026-08-09T21:39:21.712002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.756513Z","title":null,"venue":null,"work_id":"9528472b-0d6b-47e5-9322-e053de64d2ed","year":2023},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.717944Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:7c99f09acc6d2a1a05a199d7b5de980cb39f617d0bcd0cfbb0dc0a609e51bdd5","observation_id":"7fe2c3aa-28cc-4d73-89b8-53e7f6111f89","resolution":{"observed_at":"2026-08-09T21:39:22.760743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.742963Z","title":null,"venue":null,"work_id":"44a301ca-43b8-46e2-aa9f-d0e0a54f6279","year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.723054Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:fe0a46a44eaa8c88b88710557f34d5fb7a489d9419ab053a17f7fa265568439f","observation_id":"2fc817c6-8eaa-4b45-b329-e0d3eb99c862","resolution":{"observed_at":"2026-08-09T21:39:22.747349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05803","last_updated":"2025-01-25T15:59:57Z","snapshot_observed_at":"2026-07-06T18:12:05.439027Z","submitted_at":"2024-05-09T14:38:53Z","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05803","snapshot_observed_at":"2026-08-09T21:39:21.727495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.727495Z"},"links":{"cited_paper":"/paper/2405.05803","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:354161be74128528794aaf6715219425dc968f25cc585cc6f28bc13015122670","observation_id":"8904b5bd-f1e7-4be9-8402-952d135fd0e0","resolution":{"observed_at":"2026-08-09T21:39:21.727495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17815","last_updated":"2024-11-04T09:03:31Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T04:23:00Z","title":"Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.17815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17815","snapshot_observed_at":"2026-08-09T21:39:22.346160Z","title":"Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model","venue":"cs.CV","work_id":"1e42192a-5c43-4467-a40b-01448081c48f","year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.732229Z"},"links":{"cited_paper":"/paper/2405.17815","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:a96dccc6dde85b969993d3202672804a45f33ad14979a684f3c048d2d504fe83","observation_id":"c2915a8a-18f5-4106-8305-89651466dcec","resolution":{"observed_at":"2026-08-09T21:39:22.353394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.729533Z","title":null,"venue":null,"work_id":"1beb5b13-040f-46a8-9f07-121b4971596d","year":2023},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.736777Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:98775ddfa0ae9e468f6458e6aaf866254180817b0bf546ea59b101e2a4ca08a3","observation_id":"26fbfe0b-bf26-41e8-b36c-53bbc4b8f4b2","resolution":{"observed_at":"2026-08-09T21:39:22.733912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-09T21:39:21.741090Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.741090Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:44cdcf5cfbaedb55b7422239cce2ae9ee52f408fbf99f0f9e04d3138a9b0f8d7","observation_id":"0028a4ce-6e4a-473f-8965-2d503642b468","resolution":{"observed_at":"2026-08-09T21:39:21.741090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-09T21:39:21.745753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.745753Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:a6d36fe801ad9ce78b8b7839238c5821705afe105e0d79a58a08388c6cd905f3","observation_id":"eb1f799d-778e-4011-aa34-48b8caaebd8d","resolution":{"observed_at":"2026-08-09T21:39:21.745753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T21:39:21.750252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.750252Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:21756915836a6741475723a8227fb2767cb51dfbe657ec1231421403d858ae01","observation_id":"eee53010-8633-4f0b-b8b3-3a0d6f51fcd6","resolution":{"observed_at":"2026-08-09T21:39:21.750252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-09T21:39:21.755070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.755070Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:df513518c7736747fa056a109607d8bc2cdd102a9df4de14cb68cfacec60204d","observation_id":"8520d8b6-57ba-41ef-92d4-c0964048dcbc","resolution":{"observed_at":"2026-08-09T21:39:21.755070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11795","last_updated":"2025-04-06T18:52:08Z","snapshot_observed_at":"2026-08-04T05:24:14.383678Z","submitted_at":"2024-08-21T17:36:37Z","title":"EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11795","snapshot_observed_at":"2026-08-09T21:39:21.759828Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.759828Z"},"links":{"cited_paper":"/paper/2408.11795","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:5788d40e5086a077e752ed9efedaa7216acff568fbcc9c1e26b059f7aeb177bb","observation_id":"fbe7a7a7-d44f-448a-9640-e04258538e1d","resolution":{"observed_at":"2026-08-09T21:39:21.759828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.716126Z","title":null,"venue":null,"work_id":"45f8ad85-f977-4471-a467-6960b2da1587","year":2022},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.764670Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:c7c18a8158f11e1aa11996ca779d889c56ff1a529662ef48150abc5b37593528","observation_id":"92050a1f-59cb-43cf-b926-c22eadae543a","resolution":{"observed_at":"2026-08-09T21:39:22.720298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.701445Z","title":null,"venue":null,"work_id":"567369c6-415c-4722-b74d-206fa0d16d5d","year":2022},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.769059Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:6af1297869dd95d468b561aa9c16b28c68583ddbce14e16e5d6bdd627b4f26aa","observation_id":"3bd30714-1a7d-4e8a-94db-203ec33f5f63","resolution":{"observed_at":"2026-08-09T21:39:22.705955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.686756Z","title":null,"venue":null,"work_id":"44a5cf0c-22b9-4425-8bd5-d45084b5228f","year":2021},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.773380Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:e2c55f3d8e3693a0723e296afe7cd827d7085981b2b417ef5c8ffdc64df6bb53","observation_id":"b89ca2fe-2e41-4e92-8b88-b3c5691e8c8f","resolution":{"observed_at":"2026-08-09T21:39:22.691835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T21:39:21.777707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.777707Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:d737c86d6a17c96abb2d30154279eec276cf396ac872afd43e73dc50c8dbcd99","observation_id":"facfb774-f4a6-4f47-bfdb-fa1bd6624521","resolution":{"observed_at":"2026-08-09T21:39:21.777707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:21.782512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.782512Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:f4bf655acdc018d465a178912ff6af418480117ff910837d548c4ee9f897aa99","observation_id":"5604f3e7-d0b1-4d27-b5e3-47ba0a11af65","resolution":{"observed_at":"2026-08-09T21:39:21.782512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.671431Z","title":null,"venue":null,"work_id":"a3bebf56-3de8-4358-886d-b720a9a5d25c","year":2016},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.786916Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:a41a5d84019f165fd31822a24fc1851d7e9892e28ce5bda771bd06eafee4df04","observation_id":"ef9f0241-1058-4be1-ad63-9e59597e1cd2","resolution":{"observed_at":"2026-08-09T21:39:22.676596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.656823Z","title":null,"venue":null,"work_id":"86ccc248-44cf-4cbc-9fcb-41698086cf71","year":2019},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.791790Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:ddb7d3d17d2be4a6afbf39f16ef5634ea7504c8eb33d06bbb94a386e024497b1","observation_id":"c7d9d465-43c7-4a91-b118-0b289190c335","resolution":{"observed_at":"2026-08-09T21:39:22.661158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T21:39:21.796142Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.796142Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:6e80b7f9b711eb7b740eaaa9152fa2ecdbbe5145832b9ad8a386dbc343df2272","observation_id":"d6de5c31-b80c-4914-8aec-5a89ad417600","resolution":{"observed_at":"2026-08-09T21:39:21.796142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.641428Z","title":null,"venue":null,"work_id":"0b6fd4ac-5972-4f75-a544-627f96729088","year":2017},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.800625Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:3ba86590c92c58b1dfa3fc025538686f944710a826634b19c57b79b4d62e8b39","observation_id":"af78091b-cb08-44a2-9841-a6f6ed2f9306","resolution":{"observed_at":"2026-08-09T21:39:22.646846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-09T21:39:21.804905Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.804905Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:fd82beda88db6f62e906d3cda80eafed4b6183378d2f9743574b714c6bbc7c00","observation_id":"a8947d7f-026d-484f-8822-50cce7a77ca7","resolution":{"observed_at":"2026-08-09T21:39:21.804905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T21:39:21.810068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.810068Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:93f8ada13209cf8143981135e0dbd31a43616c0c3b09c0557bec527c3efde149","observation_id":"ae49b89e-fb72-4cfa-9e34-b119b4cf6da8","resolution":{"observed_at":"2026-08-09T21:39:21.810068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.626715Z","title":null,"venue":null,"work_id":"e3f61f15-f997-47d9-ab03-058e242fda68","year":2025},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.814948Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:a427ff4b014bbe0d43d8050292a8e56f2c9d93da484f45dac970f21c50a6d390","observation_id":"ffdc1457-f9ee-4721-9ab7-167d3ba27c18","resolution":{"observed_at":"2026-08-09T21:39:22.631355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-09T21:39:21.819432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.819432Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:39b7a4725cf8878b2a4bd5bcf957332e6ed638e58f39951749bb55c991b9153e","observation_id":"bb3c3ddd-942d-4ca5-98b3-0f55824435f5","resolution":{"observed_at":"2026-08-09T21:39:21.819432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-09T21:39:21.824073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.824073Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:3947c55de09d9caae4a1cec841b020f76818f265e2d65404632974170f959034","observation_id":"b1a9de48-f850-4970-9e30-ba437f924d71","resolution":{"observed_at":"2026-08-09T21:39:21.824073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.610886Z","title":null,"venue":null,"work_id":"23fde08d-2a92-45fe-8775-25e6ed3c59ca","year":2023},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.828897Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:84f71e6a0ec650a51fbc919ba027c4754d28fa546f5983358693de26ff213387","observation_id":"2c82955c-fac4-43e1-a7d3-409672aa811a","resolution":{"observed_at":"2026-08-09T21:39:22.616383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-09T21:39:21.833240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.833240Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:a9fe33d0eea2396ab8f578b183d87da019ec15b55c44609b7f3ba86b01a876f2","observation_id":"66755296-f36e-4202-8e1f-c7c826274ca8","resolution":{"observed_at":"2026-08-09T21:39:21.833240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-09T21:39:21.838073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.838073Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:b0f3c14ba498918813302e7c899b360521659773a8a3db8a555ea2faf803ed70","observation_id":"6f04beb5-771b-412e-b007-cf7135626d65","resolution":{"observed_at":"2026-08-09T21:39:21.838073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-09T21:39:21.842719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.842719Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:255d927e044affde6df11e4745b4f99c977851a4cf0f7c8696caccfa21bb3775","observation_id":"5f4d8a90-9c17-4568-987c-dd50b5a74b1f","resolution":{"observed_at":"2026-08-09T21:39:21.842719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:22.594467Z","title":null,"venue":null,"work_id":"cf164532-da98-4957-ae17-373362c2e62c","year":2020},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.847501Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:4f9b1a43acead651210593b08173abb4c76cef143c318e72553eef088e5d1a51","observation_id":"3600d8d3-1a12-40b0-ba97-0d77132c043b","resolution":{"observed_at":"2026-08-09T21:39:22.599556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19101","last_updated":"2024-12-19T08:00:44Z","snapshot_observed_at":"2026-07-06T18:37:51.919811Z","submitted_at":"2024-06-27T11:28:36Z","title":"DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19101","snapshot_observed_at":"2026-08-09T21:39:21.852342Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.852342Z"},"links":{"cited_paper":"/paper/2406.19101","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:048de1d6681cbb86a2bdf1a7c786e381ab0cc4d7059c5f618a3f7c3fd8c3cebf","observation_id":"e4ff13ee-acd1-48ef-b3e9-333580ea32ed","resolution":{"observed_at":"2026-08-09T21:39:21.852342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-09T21:39:21.856983Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.856983Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:9ad5721c377697fd9628ebd08b25a50289a7722f9d8b4a6dce3b87feaba2270d","observation_id":"471f1036-d7b9-4a2e-bf3a-37cc8e5b47fc","resolution":{"observed_at":"2026-08-09T21:39:21.856983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T21:39:21.861654Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.861654Z"},"links":{"citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:c1d8dbeb91721ddd3d958a8706ab7d6f563917f143372dc1603902c27517f3af","observation_id":"8fb32034-b8fd-4251-82eb-09d432f8f22b","resolution":{"observed_at":"2026-08-09T21:39:21.861654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2501.19036."}