{"as_of":"2026-08-09T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b50552cdb3f644877e7d405e225faee00e5384598cf08f737712e86214930efc","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:53.748135Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:36:15.783708Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13166","snapshot_observed_at":"2026-08-01T08:36:15.783708Z","title":"arXiv preprint arXiv:2506.13166 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21076","last_updated":"2026-07-23T09:08:57Z","snapshot_observed_at":"2026-08-07T17:22:43.277210Z","submitted_at":"2026-07-23T09:08:57Z","title":"C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs","version":1},"reference_index":257,"source":"arxiv_source","source_observed_at":"2026-08-01T08:36:15.783708Z"},"links":{"cited_paper":"/paper/2506.13166","citing_paper":"/paper/2607.21076"},"observation_digest":"sha256:81735e7fc896f8cc8bc315402f2cb32350212f51616b54cebe2bff61d42c5ab8","observation_id":"c4f1005c-db49-4c65-b769-425c85878e97","resolution":{"observed_at":"2026-08-01T08:36:15.783708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13166/citation-record","integrity":"/paper/2506.13166/integrity","json":"/paper/2506.13166/citation-record.json","paper":"/paper/2506.13166"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.338990Z","title":null,"venue":null,"work_id":"dcf2353d-d051-4f68-b277-5966f62f7913","year":2019},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.583031Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:c0aeac5625b9f01a9cecbbb54a222fe11c818b95d9bd7bf22bf869ced6e2fba9","observation_id":"1937c3fe-d399-4306-8c5a-d8a909b7d97c","resolution":{"observed_at":"2026-08-07T00:42:54.341804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02175","last_updated":"2025-04-01T19:02:04Z","snapshot_observed_at":"2026-08-08T00:42:49.320305Z","submitted_at":"2025-03-04T01:33:14Z","title":"DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02175","snapshot_observed_at":"2026-08-07T00:42:53.586485Z","title":"R.; Singh, G.; Akbari, M.; and Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.586485Z"},"links":{"cited_paper":"/paper/2503.02175","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:6fec304522c9df86641ba617efe2707c645443e4c845257d8a2eed6766fd714c","observation_id":"b7a2c712-d4dd-404c-aaca-61c8123a70ec","resolution":{"observed_at":"2026-08-07T00:42:53.586485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10945","last_updated":"2024-12-25T01:27:01Z","snapshot_observed_at":"2026-08-08T00:42:57.985115Z","submitted_at":"2024-08-20T15:34:27Z","title":"HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10945","snapshot_observed_at":"2026-08-07T00:42:53.590496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.590496Z"},"links":{"cited_paper":"/paper/2408.10945","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:7967273eb5c9bff14c4415fa9d001b85c2de9663fccfff77e6ace56ef6b645b5","observation_id":"25f712e8-e4a4-4b03-94a6-4033a5b2d9e5","resolution":{"observed_at":"2026-08-07T00:42:53.590496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:42:53.593771Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.593771Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:842bfff8e66f56cae9b7261f00ca24a95293d918187276bcc3936b080c665c78","observation_id":"cb2f33b1-9778-4dd2-bdce-2e20ed9ffc9d","resolution":{"observed_at":"2026-08-07T00:42:53.593771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.331003Z","title":null,"venue":null,"work_id":"882b9c15-78a2-4326-b8dc-26920c2467c4","year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.596977Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:9952656fab3d1074f584c11919a053869912bf8d4dd842a9a37cf19274d0ef79","observation_id":"b6af6db1-4955-41d8-bb7d-62ddb7bbf1a5","resolution":{"observed_at":"2026-08-07T00:42:54.333814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-07T00:42:53.600247Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.600247Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:6b6254109f8d2d77480d0ffc8e8fda41107fb60cf0f0524276a591a7cf10ee1d","observation_id":"a006d69a-51f8-4768-aba8-2d08ec201e87","resolution":{"observed_at":"2026-08-07T00:42:53.600247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20092","last_updated":"2024-11-17T17:05:03Z","snapshot_observed_at":"2026-08-08T00:42:54.303187Z","submitted_at":"2024-06-28T17:57:14Z","title":"Efficient Large Multi-modal Models via Visual Context Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20092","snapshot_observed_at":"2026-08-07T00:42:53.603924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.603924Z"},"links":{"cited_paper":"/paper/2406.20092","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:e8052a0339d7822bf48113ed678bb4c81b9731b1d68ead2260d0fdeafc1ef011","observation_id":"28c77754-5715-4cfa-a80a-afb162c9921b","resolution":{"observed_at":"2026-08-07T00:42:53.603924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T00:42:53.607094Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.607094Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:3855b84b010ddd29d7eb5ba6bc266a3b734fcc4d7f988926aed61d6dcbda9e55","observation_id":"c4466222-5db8-4ae8-bf44-17d01ce99564","resolution":{"observed_at":"2026-08-07T00:42:53.607094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-08T22:33:21.852107Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-07T00:42:53.610866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.610866Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:465c2ec44fdccb0f44583ad27d92a71b4c909413c88b5ac2e9d0b1f704b5e127","observation_id":"6dc287d1-f569-467c-a16f-9564fbd18c74","resolution":{"observed_at":"2026-08-07T00:42:53.610866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:42:53.613762Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.613762Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:7ff67df0b2fd58423df7e9679652553f630f157d91940d86d5cf5b0c2b9e7bb4","observation_id":"f8b1262f-5c77-43e0-b56e-ef471deb17f0","resolution":{"observed_at":"2026-08-07T00:42:53.613762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T00:42:53.617098Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.617098Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:57e3553b1061bd0d547b00e3ecd3deade4244bf2bc2fc05d7de013a3bef279b9","observation_id":"86f8dce3-1e00-4012-bb75-02b7c0513134","resolution":{"observed_at":"2026-08-07T00:42:53.617098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.322755Z","title":null,"venue":null,"work_id":"67246503-fcf7-4c94-a3c4-d02517691bf6","year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.619924Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:d278c03cea7893620e2ce225c5ef9631d547b017a16e6648c0a59cf6746714bb","observation_id":"b77225b5-e6dc-408b-9b9e-a14f9a75ec30","resolution":{"observed_at":"2026-08-07T00:42:54.326120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:42:53.622519Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.622519Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:f53b277ccd570728437186498b2dac424d683a7dc9b296ae5997094812fad344","observation_id":"5736cb6a-0961-40dc-87df-3b4d5537d474","resolution":{"observed_at":"2026-08-07T00:42:53.622519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13180","last_updated":"2025-07-31T22:51:46Z","snapshot_observed_at":"2026-08-08T00:47:16.263621Z","submitted_at":"2024-12-17T18:56:50Z","title":"Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13180","snapshot_observed_at":"2026-08-07T00:42:53.625121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.625121Z"},"links":{"cited_paper":"/paper/2412.13180","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:9e1e78993ef7cb9125ec137299e5fb46accaefc2de6a3753e1786c4feba8388e","observation_id":"e47cb805-1a8b-4e5e-86a5-f734ea296524","resolution":{"observed_at":"2026-08-07T00:42:53.625121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T00:42:53.628108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.628108Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:4cf2fb84ac8cff3a959b6a738981a6eebb18ec9e6f5c1af9c15bfa1879aa2edc","observation_id":"31aca71c-f40a-4e95-a2d4-9898cc5aa111","resolution":{"observed_at":"2026-08-07T00:42:53.628108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08856","last_updated":"2024-04-13T00:02:36Z","snapshot_observed_at":"2026-08-08T00:44:58.546863Z","submitted_at":"2024-04-13T00:02:36Z","title":"On Speculative Decoding for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.08856","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.08856","snapshot_observed_at":"2026-08-07T00:42:54.126283Z","title":"On Speculative Decoding for Multimodal Large Language Models","venue":"cs.CL","work_id":"da4e7d1d-44ca-4e1c-836a-d8de4a635281","year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.630964Z"},"links":{"cited_paper":"/paper/2404.08856","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:99a0d1718fda03ccb7502cff61398ebcdcfef97df51f7310838bbfa09036aebd","observation_id":"13d89cbc-3c5e-4e48-b36c-be6f947ea3dd","resolution":{"observed_at":"2026-08-07T00:42:54.131638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09532","last_updated":"2025-02-01T06:13:27Z","snapshot_observed_at":"2026-08-08T00:47:07.026801Z","submitted_at":"2025-01-16T13:34:33Z","title":"AdaFV: Rethinking of Visual-Language alignment for VLM acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09532","snapshot_observed_at":"2026-08-07T00:42:53.633999Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.633999Z"},"links":{"cited_paper":"/paper/2501.09532","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:2d21abdee39da5a012cee189c97a8775f34ec420ebf5b4e63c2e73899979e449","observation_id":"4903a790-14c1-4a4a-9ef7-034902d90dfc","resolution":{"observed_at":"2026-08-07T00:42:53.633999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.315018Z","title":"A.; and Manning, C","venue":null,"work_id":"e777cf22-d617-4fda-9b9d-93bcc9ac992f","year":2019},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.636916Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:9e5470c1bac995605238adb1901eb9992bd4db550d82fa3432ce29af9ce0868a","observation_id":"b27d5629-613c-475d-8d83-4df6dcf03fc1","resolution":{"observed_at":"2026-08-07T00:42:54.317632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:53.640084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.640084Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:e807521cf2255b7f0b2f3177b3a591a075539b64ceba2a925eb8b1b766249287","observation_id":"211f7554-d804-4ebd-a940-a28672649b2b","resolution":{"observed_at":"2026-08-07T00:42:53.640084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.306456Z","title":null,"venue":null,"work_id":"3e6c578e-eecf-48ae-b385-27a9cea8495c","year":2014},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.643357Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:5630b63b4b96b85418f2d239239c4dea5759c8d2e7b8a8729e90d845ae839fe5","observation_id":"4377c1ce-e8cd-4a1c-b578-336be540c6ea","resolution":{"observed_at":"2026-08-07T00:42:54.309726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T00:42:53.646688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.646688Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:ee51ff97e8625d1ffab0d1342ad399020ada963bdd887841d7fd7c0ce5e5fb25","observation_id":"b87afc1c-3f1c-41d0-9cba-d4e7caf476b7","resolution":{"observed_at":"2026-08-07T00:42:53.646688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.297017Z","title":null,"venue":null,"work_id":"5d1c9fab-85cb-4b3c-82a9-e82b6f878a12","year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.649968Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:56efb0b230ae8dcb5b74ea2a2f06008ac4360300513c9ca70c18b95911a4d92e","observation_id":"5395214e-ad08-4edd-b7fd-34f8c487b2ad","resolution":{"observed_at":"2026-08-07T00:42:54.300470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14204","last_updated":"2025-01-24T03:20:37Z","snapshot_observed_at":"2026-07-06T20:25:22.313860Z","submitted_at":"2025-01-24T03:20:37Z","title":"Dynamic Token Reduction during Generation for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14204","snapshot_observed_at":"2026-08-07T00:42:53.653335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.653335Z"},"links":{"cited_paper":"/paper/2501.14204","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:bec3196eaab10f3f21f7f888ce03d5c902c9dec840b199bb7736f231110a1861","observation_id":"d7c2a526-d729-4429-b403-e74d6e6bf84a","resolution":{"observed_at":"2026-08-07T00:42:53.653335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T00:42:53.656785Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.656785Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:bb191b6b5d6ce317f5c89dc96cf7679fab331127c3ff94d69f4ae13bc2b9919e","observation_id":"2aa64794-545e-4a05-a1dd-69b1fc00e808","resolution":{"observed_at":"2026-08-07T00:42:53.656785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05803","last_updated":"2025-01-25T15:59:57Z","snapshot_observed_at":"2026-07-06T18:12:05.439027Z","submitted_at":"2024-05-09T14:38:53Z","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05803","snapshot_observed_at":"2026-08-07T00:42:53.659544Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.659544Z"},"links":{"cited_paper":"/paper/2405.05803","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:ec59e02b3d68d84f6d7960d94122b6ad00d4556c45b42351f8d2f8301fa1e92a","observation_id":"b00a0740-01fd-48c8-a130-bbcfc683fd6c","resolution":{"observed_at":"2026-08-07T00:42:53.659544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.287963Z","title":null,"venue":null,"work_id":"3424b367-3dac-474d-b3bf-a1ffe8c79261","year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.662428Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:f95e74897bcd1fbe0baa7f5eae3f61f9433e94689f62bd01c241b965d96a6e30","observation_id":"d903c29d-950d-4f37-b42d-5ca3edd2571f","resolution":{"observed_at":"2026-08-07T00:42:54.290929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.277324Z","title":null,"venue":null,"work_id":"d42a9318-efa1-4442-bf74-da67d5521803","year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.665273Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:fbb454899d8b8afb67410ca28bc21b071794d248a34a689ed9fbeefa42b7b53e","observation_id":"d592996a-6d66-4233-b2b1-4689b6da923e","resolution":{"observed_at":"2026-08-07T00:42:54.280890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T00:42:53.668156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.668156Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:d3bff9aa2e9d20f0d073e7423c5fb06be94d76d91b82e293e045dc756e7b1258","observation_id":"762b43ab-b672-4b1b-b4ac-cbd32c5250f7","resolution":{"observed_at":"2026-08-07T00:42:53.668156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T00:42:53.670940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.670940Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:76798381ef20ee29437e66240854403e92a3897f3ce2f6c84e8dde03d958200f","observation_id":"5c3e1455-e133-416e-b8ee-00db0d9c04c0","resolution":{"observed_at":"2026-08-07T00:42:53.670940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.267517Z","title":null,"venue":null,"work_id":"33075799-625e-4667-8b90-04cc3af93d08","year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.673780Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:6dff5213135e64e7b3d752a6a3432be1bdf2db097b20657a4876913d46348594","observation_id":"68bbc9ad-3ecf-4f7f-897f-e87bf62e9ca5","resolution":{"observed_at":"2026-08-07T00:42:54.270686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.258559Z","title":null,"venue":null,"work_id":"438e8b3e-60b8-4ab4-8875-64004ffa4144","year":2019},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.677586Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:3db362d8889fddf2e14758b4c7285a5d563f1a7bab8819dde33b282c2b2532bf","observation_id":"e2a34564-623d-42b2-9d2e-aac72c0e50f1","resolution":{"observed_at":"2026-08-07T00:42:54.261322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14504","last_updated":"2025-02-20T12:31:31Z","snapshot_observed_at":"2026-08-08T00:46:02.547013Z","submitted_at":"2025-02-20T12:31:31Z","title":"PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14504","snapshot_observed_at":"2026-08-07T00:42:53.680275Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.680275Z"},"links":{"cited_paper":"/paper/2502.14504","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:e2feb7ff8f94cf3807e1229580c58814a9fee1c7fda0cb1a957080b57b354009","observation_id":"ef92b47f-c261-402f-b269-3b1485509843","resolution":{"observed_at":"2026-08-07T00:42:53.680275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04652","last_updated":"2024-12-05T22:47:17Z","snapshot_observed_at":"2026-08-06T19:54:11.611467Z","submitted_at":"2024-12-05T22:47:17Z","title":"Cross-Self KV Cache Pruning for Efficient Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04652","snapshot_observed_at":"2026-08-07T00:42:53.683212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.683212Z"},"links":{"cited_paper":"/paper/2412.04652","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:66403167685b5a694d65cd09eef7c5548edec6a6871bc9efc41dcd7c125e192a","observation_id":"ec33be87-522c-480f-932f-c7ba9307b7fb","resolution":{"observed_at":"2026-08-07T00:42:53.683212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-03T10:48:50.688044Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-07T00:42:53.686184Z","title":"A.; Wang, L.; Cervantes, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.686184Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:8a7ddaee7fd399202a5eeef1118260367e73e0def4d7574f097105ff62ff2e68","observation_id":"d1e6a688-4d00-4f77-913b-2b58ee3d0394","resolution":{"observed_at":"2026-08-07T00:42:53.686184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.249636Z","title":null,"venue":null,"work_id":"2fda972b-0a8f-4e1f-b9b7-7c69598f51bf","year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.689290Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:11a3eaa50302ea60bbcb7f8e9c26f1d70a83a08fab744f61a6ff85e7d40c9a94","observation_id":"96e55dfa-522f-4d73-8f1a-764ff736e1fd","resolution":{"observed_at":"2026-08-07T00:42:54.252955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:53.691986Z","title":"J.; and Yan, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.691986Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:f0dd9d736f9aab26603ed79d8dd8614ff89584e3039c308f75178e1389c327a8","observation_id":"1c913274-7dc2-43a5-8a5b-cfd530c8c3c0","resolution":{"observed_at":"2026-08-07T00:42:53.691986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:54.241133Z","title":null,"venue":null,"work_id":"dfc88ac3-2d31-48e9-9386-69a5e75bac44","year":2019},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.694891Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:b59938b4080b4c4c80e9d225c5201e5d2c201c2924c0e1fb39c4a397adffc8d5","observation_id":"b1584c28-ad25-463e-8288-d5675992814b","resolution":{"observed_at":"2026-08-07T00:42:54.243883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T00:42:53.697593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.697593Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:453f94fd8d3278613724c282d99e2a44661ce2176e3ab10dbe72908e85b496a2","observation_id":"c0d316f9-e94d-480b-ace7-8ddb0eb2d774","resolution":{"observed_at":"2026-08-07T00:42:53.697593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T00:42:53.700721Z","title":"N.; Kaiser, L.; and Polosukhin, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.700721Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:6ef314a357bc6d55e4268f76376260c260257bd7dc3682a44741ef7f5b3e14f4","observation_id":"fc21fc7c-29c3-408e-acfa-5ccb1351c664","resolution":{"observed_at":"2026-08-07T00:42:53.700721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:42:53.706996Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.706996Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:97d3b731fc8e10587a463e0627fbe7d276d969d40e1d42aa518e492826f5ddcc","observation_id":"bdab7b9c-11ef-4e1c-bffd-77bb99cddea0","resolution":{"observed_at":"2026-08-07T00:42:53.706996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11501","last_updated":"2025-05-29T09:18:35Z","snapshot_observed_at":"2026-08-07T18:13:30.730921Z","submitted_at":"2025-02-17T07:05:36Z","title":"Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11501","snapshot_observed_at":"2026-08-07T00:42:53.711824Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.711824Z"},"links":{"cited_paper":"/paper/2502.11501","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:c6ac5ab38826f4c24f3217da51015b4c3a69313186ebdbe1bc2ba627d5ade5d0","observation_id":"76a83887-ed54-4d0b-b283-ee5ffa438ff3","resolution":{"observed_at":"2026-08-07T00:42:53.711824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-08-08T00:45:20.646947Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-07T00:42:53.714494Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.714494Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:7b884740bcce1cb60c083b8b59cfb783b6cc4c3bc00c9ed11f978197d92f68c2","observation_id":"c9c746f1-31d2-490e-8228-fa4366114b7c","resolution":{"observed_at":"2026-08-07T00:42:53.714494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01812","last_updated":"2024-02-05T09:21:28Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T05:55:11Z","title":"PPT: Token Pruning and Pooling for Efficient Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01812","snapshot_observed_at":"2026-08-07T00:42:53.717242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.717242Z"},"links":{"cited_paper":"/paper/2310.01812","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:00a70bd2527b6499762260e7c5fe28c37f07e609b695342a950ba172d1f3caa8","observation_id":"ee264910-fc3c-4278-844e-046696587501","resolution":{"observed_at":"2026-08-07T00:42:53.717242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-07T00:42:53.720397Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.720397Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:37ac0821bd19f48f721b14ace6c901c0f9307016f79e2bd8419a10fa49ee04af","observation_id":"c932c310-bd25-4d2e-a585-1509734538bf","resolution":{"observed_at":"2026-08-07T00:42:53.720397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19409","last_updated":"2024-07-28T06:10:47Z","snapshot_observed_at":"2026-08-08T00:44:59.660812Z","submitted_at":"2024-07-28T06:10:47Z","title":"LLAVADI: What Matters For Multimodal Large Language Models Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19409","snapshot_observed_at":"2026-08-07T00:42:53.723737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.723737Z"},"links":{"cited_paper":"/paper/2407.19409","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:c830af9333128b77f121b43da9ca1ca79a3da1ac6eda54cfb9fbb9984906e282","observation_id":"de262bfa-471e-4cac-a700-7eaeb0dd31f7","resolution":{"observed_at":"2026-08-07T00:42:53.723737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:53.726470Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.726470Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:58c6bcf06d408b42b5ba3a851a93fb0b7aa4f5f9d6eab8634e4538b6a0009bdc","observation_id":"c02edbf5-cee7-49ad-8321-415708e887bf","resolution":{"observed_at":"2026-08-07T00:42:53.726470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T00:42:53.728937Z","title":"A.; Hu, K.; Liu, S.; Zhang, Y.; Yang, J.; Li, C.; and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.728937Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:701bf728300477a884e3e7078679bb901ff7903e4e645a03c7c593248d75b61f","observation_id":"1805c7fa-a03b-4a40-92f1-0c7d95361a3f","resolution":{"observed_at":"2026-08-07T00:42:53.728937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-07T00:42:53.731513Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.731513Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:a0fa7bd57902e92ecfa7cca91e7a7ec374bee6d12e683f3821cd462eb302da34","observation_id":"a1a373ab-ce2e-4b1e-8eac-7867ae7a5305","resolution":{"observed_at":"2026-08-07T00:42:53.731513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18620","last_updated":"2025-03-25T18:59:50Z","snapshot_observed_at":"2026-08-08T00:46:18.717835Z","submitted_at":"2024-11-27T18:59:26Z","title":"Cross-modal Information Flow in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18620","snapshot_observed_at":"2026-08-07T00:42:53.735239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.735239Z"},"links":{"cited_paper":"/paper/2411.18620","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:7b6b2bc5f22f79eeae59cbc8a141319355d1a7fa331dffd7202b7bab2ed65861","observation_id":"03c0985e-2934-4751-9bbb-32103dfcca6e","resolution":{"observed_at":"2026-08-07T00:42:53.735239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-08-08T00:43:47.244767Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00556","snapshot_observed_at":"2026-08-07T00:42:53.738046Z","title":"N.; and Yu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.738046Z"},"links":{"cited_paper":"/paper/2412.00556","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:12071a66963d2a7a09d8477f94fdc0f08aef32e715112bcce480417061b94070","observation_id":"3f8c6000-e94e-4211-804f-d21e7746ec13","resolution":{"observed_at":"2026-08-07T00:42:53.738046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T00:42:53.740963Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.740963Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:74a9ea3e26d1157ab5bd32a34a4156a4866023004350911552904e0a76e66bf5","observation_id":"907bf8a8-c945-432f-95bc-dd27e53298f0","resolution":{"observed_at":"2026-08-07T00:42:53.740963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:53.744129Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.744129Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:9203aeb37416103fa2dd60ed6d74f01edc8ce6e71887d269f8df5bd76eed7a7d","observation_id":"9296db2a-e545-4242-800e-a71b07ffbaba","resolution":{"observed_at":"2026-08-07T00:42:53.744129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:53.748135Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.748135Z"},"links":{"citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:3579d487c2202962f684b3e171b17475abd216d3167f4dd4faa36691b04e56c5","observation_id":"0c7ae028-da2a-4028-bf68-ba1266c43ef7","resolution":{"observed_at":"2026-08-07T00:42:53.748135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2506.13166."}