{"as_of":"2026-08-11T01:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37f6ffba23ebb3f0a1ee7738011048d879e9a3a3e4e5a9e80bfb086ff2f08520","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:30:14.292670Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:09:53.785860Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:824d0875280d3f4d889345dfed754f814f9ba5b078bb24dd24587d8eacf263d6","observation_id":"9f142b27-cac9-4666-a592-a5452ab23db9","resolution":{"observed_at":"2026-05-23T00:02:17.821582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T13:43:02.340523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.340523Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:902f6762c9203f0dfe3defee41fa2877827861246db5b29984c31ef2fbb3b90a","observation_id":"6ba2346a-6f98-45c9-a41c-80c1c81e0659","resolution":{"observed_at":"2026-08-07T13:43:02.340523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T12:06:25.772527Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model.arXiv preprint arXiv:2411.10803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00577","last_updated":"2025-05-31T14:22:40Z","snapshot_observed_at":"2026-08-07T22:33:33.136985Z","submitted_at":"2025-05-31T14:22:40Z","title":"Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.772527Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.00577"},"observation_digest":"sha256:139d480f7b21c7f3b15807ab2ce7c261f688e9b4e18171768bfe7ac1e01dbe58","observation_id":"6b97be4f-8fef-4016-847b-682b060c615b","resolution":{"observed_at":"2026-08-07T12:06:25.772527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T04:20:31.753984Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T17:11:06.528222Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.753984Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:0c42a3adefe9cbcf5d5bca22a73c7833969da4c7d5be1ae6be6336fb83de6c94","observation_id":"731567cb-7de2-446a-b222-3b662f87a2da","resolution":{"observed_at":"2026-08-07T04:20:31.753984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T00:42:53.668156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.668156Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:5bee90ec9e0cb2eab40baa1d8e136f8c149ac2f142859269d29ddac0f84bf9dd","observation_id":"762b43ab-b672-4b1b-b4ac-cbd32c5250f7","resolution":{"observed_at":"2026-08-07T00:42:53.668156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T22:24:29.549834Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model.arXiv preprint arXiv:2411.10803,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:29.549834Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:fc27d8e3c08728148394e79613d84ac9fbeef3050d24d569c8f082c86603af22","observation_id":"a8c4a900-5f2d-47c0-821f-41283f54c042","resolution":{"observed_at":"2026-08-06T22:24:29.549834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T13:18:03.452277Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.452277Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:84a873b909eab49aad5966aeec0c853892e49c5b7a8c1685a4d86e036d600c48","observation_id":"d0eca418-d976-4faa-adc6-75a5568b58d2","resolution":{"observed_at":"2026-08-06T13:18:03.452277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T05:51:15.987225Z","title":"arXiv preprint arXiv:2411.10803 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01236","last_updated":"2025-08-02T07:22:08Z","snapshot_observed_at":"2026-08-10T07:22:51.828098Z","submitted_at":"2025-08-02T07:22:08Z","title":"Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:51:15.987225Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2508.01236"},"observation_digest":"sha256:2c44eec5677b3825f52b7e18e4553a3853934d756b6ed00972c57b39a49046bf","observation_id":"3ddc02e1-1c64-435e-a3f3-29e50eaa25fb","resolution":{"observed_at":"2026-08-06T05:51:15.987225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:ab33dffdb7193b6ae7b84e127fcf84b93cca1048eeb06c44730997b56687bacf","observation_id":"dcff0bad-9c40-47ae-9458-c26b0d523365","resolution":{"observed_at":"2026-05-21T15:10:16.490773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-03T02:57:46.086957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09431","last_updated":"2026-05-24T12:21:22Z","snapshot_observed_at":"2026-08-03T02:56:43.461670Z","submitted_at":"2026-02-10T05:51:02Z","title":"Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T02:57:46.086957Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2602.09431"},"observation_digest":"sha256:b16416c07c2635181a8fcb58f5138d5ff60e9a548903c723d46b3a10d8c721e0","observation_id":"a264c7a1-7d9c-4008-99ed-4e807bc9dd5a","resolution":{"observed_at":"2026-08-03T02:57:46.086957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:9315efd916a66fd61bfe26c375af4c1494aabbe4a3ae3bff15b3ca334d5dff92","observation_id":"c04c2190-6cf4-4248-a223-772acb2fbd56","resolution":{"observed_at":"2026-05-15T18:26:26.920542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:12f40b3254ff84713cc6858a6c592910debdf2ea56cb3670294bc43dc15c0bc0","observation_id":"9d97cbca-ed4a-4607-b337-de37b2c26d8e","resolution":{"observed_at":"2026-05-11T10:41:04.436181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2604.17087","last_updated":"2026-04-18T17:52:02Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T17:52:02Z","title":"EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T07:00:36.870817Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2604.17087"},"observation_digest":"sha256:261111c9e09833f38c568511bcf69e630970b593bcbc2975f4c77bd07799d8f3","observation_id":"e536b025-dadf-432c-896c-4eeb897aa608","resolution":{"observed_at":"2026-05-10T07:01:49.121922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.17447","last_updated":"2026-05-17T13:39:47Z","snapshot_observed_at":"2026-08-02T22:21:28.317441Z","submitted_at":"2026-05-17T13:39:47Z","title":"FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:57.376715Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.17447"},"observation_digest":"sha256:680512be527d6ad3d1728d9b782092b6d7c5910e28539d5a1cba4877a3f9f671","observation_id":"e35a6860-e50e-4911-b3a9-e07247782165","resolution":{"observed_at":"2026-05-20T14:58:24.845055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.19218","last_updated":"2026-05-19T00:45:00Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-19T00:45:00Z","title":"Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:43:18.828740Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.19218"},"observation_digest":"sha256:8367bb41bf58141320931b4ce8bc3ff8089b9f53a5f4de498e0cef31fffde073","observation_id":"2adc0b12-fb7d-4065-999e-67083037bda7","resolution":{"observed_at":"2026-05-20T07:43:23.798277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.30010","last_updated":"2026-05-28T14:36:44Z","snapshot_observed_at":"2026-08-02T23:58:30.012302Z","submitted_at":"2026-05-28T14:36:44Z","title":"EarlyTom: Early Token Compression Completes Fast Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T08:16:02.536341Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.30010"},"observation_digest":"sha256:25f8c3fd9756b6375ec7d52bdc5ca8c1b04a2729289ea3f6b1fa1ff24745bafa","observation_id":"5eaa3acb-9858-4fa4-8e60-b1bc9710040d","resolution":{"observed_at":"2026-06-29T08:23:15.629708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:9b99859f1d6921767e65d76b692ed5fa627894d1eb91bb8d3f7316db58556c9e","observation_id":"7b92e2ef-7f1f-4dde-83e9-3d2bcd497210","resolution":{"observed_at":"2026-06-29T08:23:15.866979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2606.12412","last_updated":"2026-06-10T17:59:57Z","snapshot_observed_at":"2026-08-03T05:45:43.148184Z","submitted_at":"2026-06-10T17:59:57Z","title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:24.118536Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2606.12412"},"observation_digest":"sha256:385ba4199bc82074db16e9c9a44940a205f59924c79990a887a9feef07426127","observation_id":"4c9a07ee-aa4e-4607-95e9-d6b945e612eb","resolution":{"observed_at":"2026-07-03T11:28:04.147290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2606.27161","last_updated":"2026-06-25T15:29:37Z","snapshot_observed_at":"2026-08-04T02:05:59.242279Z","submitted_at":"2026-06-25T15:29:37Z","title":"TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-26T04:24:38.917137Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2606.27161"},"observation_digest":"sha256:28986aaf7249b637b63896ce66bb5414645699fcf411605ba1d840f3ed7f0a68","observation_id":"78b96a77-ebe3-4938-adc2-b267a4e911e4","resolution":{"observed_at":"2026-07-04T14:09:53.787431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2606.31383","last_updated":"2026-06-30T09:11:50Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:11:50Z","title":"MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T05:41:04.184461Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2606.31383"},"observation_digest":"sha256:e336366955c197f69922d2c5b133328260ce7e69898028347d7dc174f2e2f538","observation_id":"c222cc31-d96b-440e-80bd-170880e2e2bd","resolution":{"observed_at":"2026-07-01T10:15:44.621408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T05:03:26.664752Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.664752Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:a4063104f37513e8fd988e68a6d4d5ad9ac94fc2a9dc55736dd19b8f8ac29c5c","observation_id":"13493d25-1882-4ac2-9c22-5251d778b29b","resolution":{"observed_at":"2026-08-02T05:03:26.664752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T03:42:14.989028Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-10T17:11:45.022865Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.989028Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:f3c511436e3c4f587552763782666b6ab0cc648333c4895e6ae711b7177c5720","observation_id":"2cac17e1-2c7a-41fb-9ea6-fe26463ff5d8","resolution":{"observed_at":"2026-08-02T03:42:14.989028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-01T01:26:50.559182Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25818","last_updated":"2026-07-28T15:01:02Z","snapshot_observed_at":"2026-08-08T17:11:46.682074Z","submitted_at":"2026-07-28T15:01:02Z","title":"SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T01:26:50.559182Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.25818"},"observation_digest":"sha256:a3b4825e2d0756c9cb9e6f1f722e7c970af0436bd7091c13898bc3198200e79c","observation_id":"6d05624f-a8bc-480b-9d30-1829bd76b99e","resolution":{"observed_at":"2026-08-01T01:26:50.559182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-04T17:23:16.283827Z","title":"arXiv preprint arXiv:2411.10803 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01979","last_updated":"2026-08-03T09:42:34Z","snapshot_observed_at":"2026-08-09T11:30:20.131465Z","submitted_at":"2026-08-03T09:42:34Z","title":"ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T17:23:16.283827Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.01979"},"observation_digest":"sha256:1e52699bedc6a6f07d86753bf437418a08cfbe7138ad5bcc73d54d995584882a","observation_id":"56ac6f38-9978-46a6-aff6-7293d6157dac","resolution":{"observed_at":"2026-08-04T17:23:16.283827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-05T16:41:28.857602Z","title":"Multi- stage vision token dropping: Towards efficient multimodal large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03580","last_updated":"2026-08-04T12:34:46Z","snapshot_observed_at":"2026-08-10T21:11:28.904829Z","submitted_at":"2026-08-04T12:34:46Z","title":"SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:28.857602Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.03580"},"observation_digest":"sha256:e6205125bf37f5af2b23a42887de3e623f6149cc1b940da2e1340f080d5252b2","observation_id":"a8bd15c3-4ac0-4d71-9160-9ad85923ffd8","resolution":{"observed_at":"2026-08-05T16:41:28.857602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-10T04:30:14.292670Z","title":"arXiv preprint arXiv:2411.10803 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-11T01:11:43.651916Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.292670Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:2169a869f1ed4cc14dff89fa9f77c2d108970c186f6d0810b4d281a6aa4d3615","observation_id":"b888b749-faa7-4be3-b08e-3024b0e967d0","resolution":{"observed_at":"2026-08-10T04:30:14.292670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10803/citation-record","integrity":"/paper/2411.10803/integrity","json":"/paper/2411.10803/citation-record.json","paper":"/paper/2411.10803"},"outbound":[],"paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T17:11:11.819275Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2411.10803."}