Pith. sign in

Paper Citation Record · LEDGER

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

As of 18 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 30 inbound Pith citation observations for arXiv:2411.10803.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.10803 v1

Coverage vector

measured 48 of 48 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T19:21:14.766061Z

measured 78 of 78 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 30 of 30 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T23:31:12.932387Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T14:09:53.785860Z

Reference resolution

48 of 48 outbound references displayed

  • verified exact0
  • verified fuzzy21
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 90864fc1-f830-4d83-8382-7eb430667e2e · outbound

This paper cites GPT-4 Technical Report.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.545749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.545749Z digest=sha256:d6afabc5802bd45cc51acf464b5e8b21de122c13bbbf2c4cc8b746c4d9380a72

Observation 2ba16e14-8183-487c-8ee0-98d720c1287d · outbound

This paper cites HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.555290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.555290Z digest=sha256:6817fdb2214190ff56eb220d922ce7f254366ef41098f102c443ed63c41f0c5a

Observation 0cf07494-df73-4d0f-9a8e-af7dab5165dd · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.561589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.561589Z digest=sha256:845b611c8e13065ce0c87dd7dee864afc02b9412c1229f1df8c8952b37080b52

Observation ec4711df-b311-4043-81cf-720c20357eac · outbound

This paper cites Vizwiz: nearly real-time answers to visual questions.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Vizwiz: nearly real-time answers to visual questions

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.723701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.566569Z digest=sha256:c25430821c3af38c6cfaad4db242054c2182959ce04df1efa56d2fe26f669d6c

Observation 59ce88ca-8c8d-4533-a298-17232e8455b6 · outbound

This paper cites Token merging: Your ViT but faster.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Token merging: Your ViT but faster

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.570780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.570780Z digest=sha256:49f3716d9e029df1d6d59420cc8e428e1f6a6add14c50d8c7e25731386c3216b

Observation fe9f75e7-9399-4572-8c87-08ccdb358a52 · outbound

This paper cites Lan- guage models are few-shot learners.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Lan- guage models are few-shot learners

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.702973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.574989Z digest=sha256:778c80f9c425f4f6716108a20e20dd2c4a88e78400fd7a4e7357db1b1e62f481

Observation 63edf87f-65b1-43e9-849d-4134efc7fae6 · outbound

This paper cites An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.580130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.580130Z digest=sha256:54d110b494864890a20ceb78084c7f4189ba1623d00605885647d9dea38a8551

Observation 74fb69d7-221d-451a-9d70-0359b041a938 · outbound

This paper cites Qlora: Efficient finetuning of quantized llms.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Qlora: Efficient finetuning of quantized llms

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.584674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.584674Z digest=sha256:22b85ca2b02e918a2199acde3bff76202bb50fd7949b833d023c85b69ae15907

Observation df0fb3af-f239-4543-98bb-7e7a38d06a3c · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.589420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.589420Z digest=sha256:801bf0152230ee12f4262464459e24a9c8f123f2c31f9f4c2292c8ff9b21bf8f

Observation a7e8d820-3121-4b8c-b1c1-d96c6da4c693 · outbound

This paper cites ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.594220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.594220Z digest=sha256:ceb782225370fc74e80c1a16c58849553a2b23dc84794f6e1a54d32d59480e88

Observation b7632f18-9eeb-44a2-ae4f-f5cc592fb010 · outbound

This paper cites Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.671374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.599357Z digest=sha256:b6cf0bf1c2e304573fce5830fbe9a7f2c6080921b8e726f35290de4cf5f9435e

Observation 7900d443-6024-407c-a331-a9f51ed33260 · outbound

This paper cites Cogagent: A visual language model for gui agents.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Cogagent: A visual language model for gui agents

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.657777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.603665Z digest=sha256:8ccfd7bcdd95b8d84559b45d2497a87c41b60dbe4f84417105fb04bdf311f58f

Observation d2aa05c7-75c4-4c84-b425-2ed6babad4e0 · outbound

This paper cites Lita: Language instructed temporal-localization assistant.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Lita: Language instructed temporal-localization assistant

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.643799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.607779Z digest=sha256:3e62fcb9ae32227af5443c7853b2f764fbe8b7346e5cda4b92318fc293476c17

Observation 21fe686c-4fec-48f2-ba7a-fae3718c4987 · outbound

This paper cites GQA: A new dataset for real-world visual reasoning and compositional question answering.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model GQA: A new dataset for real-world visual reasoning and compositional question answering

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.629262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.611778Z digest=sha256:1e20d69ef27abaad4205f960f8245dc6e081851fec80493163fda82a189d9bf2

Observation 7f008554-ad28-4410-be93-66d9c3929c91 · outbound

This paper cites Tgif-qa: Toward spatio-temporal reasoning in visual question answering.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Tgif-qa: Toward spatio-temporal reasoning in visual question answering

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.616586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.616627Z digest=sha256:977a54ceb1d89731ca9b5e073890558b12915a36337155f3f2c28822ab9866e9

Observation 546f1cdc-6d81-4930-9172-add9e7692d8f · outbound

This paper cites Turbo: Informativity-driven acceleration plug-in for vision-language large models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Turbo: Informativity-driven acceleration plug-in for vision-language large models

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.602253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.621130Z digest=sha256:02047c4e9017a4e5dfd4d695cba3a233c852d4b47230ec49adb313d712d5a424

Observation 5048f24a-5b5d-4765-afc9-a1772d323ab7 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.625130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.625130Z digest=sha256:9e89f62e1a7a8eac282437497a7544717c2da7fa4e647da52e316094d2675eb9

Observation 7e524ec4-cee8-46f3-9228-d64dad492558 · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model VideoChat: Chat-Centric Video Understanding

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.629754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.629754Z digest=sha256:6eb3256656a9a45b6f9da2386ae8b793750b9ecea3ce4839f3f272db14c093d0

Observation 3acf5675-711b-4a42-8e66-45b338422fa1 · outbound

This paper cites Univs: Unified and universal video segmentation with prompts as queries.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Univs: Unified and universal video segmentation with prompts as queries

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.579094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.634746Z digest=sha256:6c9ee1f2a7b69532760db40e9e35e59a27bdbfec8b1ad56a2e1e14d3b39c98ce

Observation b1b4e3f4-7f34-42dc-ab74-a7cfcff93cca · outbound

This paper cites Not all patches are what you need: Expediting vision transformers via token reorganizations.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Not all patches are what you need: Expediting vision transformers via token reorganizations

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.566882Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.639331Z digest=sha256:eb07c8f1cb7ff7470ec55f33db6ac0f399d403450619482a1f3e7922d64a0af4

Observation 1b8202f7-6a04-4e51-bdac-b5119199b81a · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.643364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.643364Z digest=sha256:b4a5b541b985c99a73de1bda4318cea0970d86707f1d4478ba27ee17305eb537

Observation e82f5b42-a0ba-4bb4-a49b-1ebea5a60523 · outbound

This paper cites Improved baselines with visual instruction tuning.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Improved baselines with visual instruction tuning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.647508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.647508Z digest=sha256:c9076439cacb14009de77eaa39b8c047e3f4233afe1cff1682bc9c97fbca9e37

Observation d920a1f9-03ac-4574-9bb7-3b8b9f077175 · outbound

This paper cites Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.653288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.653288Z digest=sha256:3bffb846fbd9bc06a6bcc49f9e20d0367647bd66880735cd4e3d2d5450700d00

Observation 25aa0eac-4f08-4ec1-8bb3-d2c2c31cfad5 · outbound

This paper cites Visual instruction tuning.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Visual instruction tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.660479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.660479Z digest=sha256:ae6a7868729ee3fe29771172ef27c62d5dd9e1ab77d9ae1f9df8c6f2707a03d5

Observation 120106a2-2cff-4f79-9ad0-fa0feedcb873 · outbound

This paper cites World model on million-length video and language with ringattention, 2024.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model World model on million-length video and language with ringattention, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.526830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.666039Z digest=sha256:e9f1c22af58692a2cbf9ef45870e0e57acd09463d5d54adf1af528886a49e171

Observation ffe86533-16a5-4952-ad35-51c99c3969bd · outbound

This paper cites Sparse-Tuning: Adapting vision transformers with efficient fine-tuning and inference.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Sparse-Tuning: Adapting vision transformers with efficient fine-tuning and inference

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.671376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.671376Z digest=sha256:932fb92b527a5b5487fce037affcd0d3991d50802cc08a44dd27a9f9c010d569

Observation f2784e95-37e2-41c9-9435-c82d1d70b763 · outbound

This paper cites Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.675533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.675533Z digest=sha256:cb4209a3ae39e95d9b3fd33f84e46ea440b1e3cd463ec7948e64d9888746d97f

Observation 5926270f-a6de-4566-90a6-1453b9c0c142 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Learn to explain: Multimodal reasoning via thought chains for science question answering

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.679471Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.679471Z digest=sha256:fafdd8dbdd129564404b243c3c3ce0526110e9c00e2916dad18abbd6b66ed1e3

Observation 109af63e-a835-47c7-a941-64aef8be0380 · outbound

This paper cites Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.684308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.684308Z digest=sha256:d97644b4120efe2188d13f519ce2a1f70ea529165736299354fd098235039ae4

Observation f795fdce-73ee-491b-8a09-57add7987980 · outbound

This paper cites Language models are unsu- pervised multitask learners.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Language models are unsu- pervised multitask learners

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.688781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.688781Z digest=sha256:eb6da26d66746efeb9955bbc6d60a596e5c979fb50e45174d22ce8ddbf8e3afa

Observation 09c4afb1-a030-4e76-9c51-a5a55d6471c7 · outbound

This paper cites Learning transferable visual models from natural language supervision.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Learning transferable visual models from natural language supervision

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.492666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.693199Z digest=sha256:ecb583c4bd6d218e3654403203f8574c4aaeb52be182b76e41747d6fbdf7a831

Observation 7f523732-1f7d-4d7c-87ad-1d0807245fc1 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Direct preference optimization: Your language model is secretly a reward model

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.480330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.696970Z digest=sha256:b6a2a82b90207fbc5ac19ec0ec0bf3491c0613b0144694ebd6a1a51716a9387e

Observation 218ee6ca-d0cd-406d-afa8-ab4659e9c1db · outbound

This paper cites Llava-prumerge: Adaptive token reduction for efficient large multimodal models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Llava-prumerge: Adaptive token reduction for efficient large multimodal models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.701155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.701155Z digest=sha256:c35618865c7bde9cf901fff6a48597b6d3bcf91f37dd5fd4131235ad53d3dacd

Observation 9a515ffd-d675-4c9d-8312-df2957c7c3db · outbound

This paper cites Towards VQA models that can read.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Towards VQA models that can read

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.469342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.705116Z digest=sha256:0b0ecc988f158f119962ad535155c257a64be614fee8033d8d05dbdac3ce3f93

Observation 1d69b5c5-551f-417e-bba5-93bfb65da4d0 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Gemini: A Family of Highly Capable Multimodal Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.713492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.713492Z digest=sha256:58879f5bd0b2b2fb5d9e75f974dde4479e6f03f8f1f2c692c5887196a2ecc70e

Observation ad812a0d-efe5-44e1-9170-5edaed08b250 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.717705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.717705Z digest=sha256:8fca43e6040deb6b211e189b794e3f9d0b5a234af90baa330e4b6f0d2604481e

Observation dd8687ff-1aa5-46c4-8d04-46ad9834cf6b · outbound

This paper cites Attention is all you need.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Attention is all you need

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.722140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.722140Z digest=sha256:1d895e48c80f5e04608fe45c03d105d4a81e9964b5308c0723b339dc248e9949

Observation 0b8f65aa-c970-41fe-a198-dcaa65a8dfb4 · outbound

This paper cites CogVLM: Visual Expert for Pretrained Language Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model CogVLM: Visual Expert for Pretrained Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.725897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.725897Z digest=sha256:6bf75eedce8ebd537184034445423b810728ce436cc08d780f4ebfdfc365020d

Observation 1dd05ada-3e01-4ee0-8061-a1c98917708d · outbound

This paper cites Can i trust your answer? visually grounded video question answering.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Can i trust your answer? visually grounded video question answering

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.446333Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.730239Z digest=sha256:77ffd784b7298952842d17acbd911db434307b42fdb0057e33bcd3e4ea564792

Observation 03ac8755-664e-4e3c-add4-7f33b7f4c244 · outbound

This paper cites Video question answer- ing via gradually refined attention over appearance and mo- tion.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Video question answer- ing via gradually refined attention over appearance and mo- tion

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.431582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.734110Z digest=sha256:9e87f485c9af38cc54185e4598987b5b630b2871297d7174ae7c950837eb1fd3

Observation 8cbbe51a-842f-47a5-888f-e5c9936cb268 · outbound

This paper cites Zero-shot video question answering via frozen bidirectional language models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Zero-shot video question answering via frozen bidirectional language models

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.417905Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.737923Z digest=sha256:eb549c45e0e8a22a6f9753b68f73088376e3495f43b3d3726b3631e261b04a50

Observation c966751d-677d-4b39-983b-438a783cffc4 · outbound

This paper cites DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.741696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.741696Z digest=sha256:0b97dd3143949b2cddd74f70a7fbd2fc8b2e03e749697c3b0938452d358b69be

Observation 30fd9868-b180-4977-b031-44e152b3eaa3 · outbound

This paper cites Tree of thoughts: Deliberate problem solving with large language models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Tree of thoughts: Deliberate problem solving with large language models

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.405013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.745921Z digest=sha256:3e9abf5c76de471aa9ec7e4dbd56dad717ecccc8e2482cc8815cfe8865edfee1

Observation 68427e43-9baa-4705-ba2c-1513d9ef9ee4 · outbound

This paper cites Ferret-ui: Grounded mobile ui understanding with mul- timodal llms.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Ferret-ui: Grounded mobile ui understanding with mul- timodal llms

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.392706Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.749805Z digest=sha256:45b00393638cfae97a8813848c45b32d212c1356ae8ff7a821ca7c9d443102d8

Observation 09742380-dbcc-4ccb-9a39-312369a06e4f · outbound

This paper cites Magic tokens: Select diverse tokens for multi-modal object re-identification.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Magic tokens: Select diverse tokens for multi-modal object re-identification

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.377959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.753571Z digest=sha256:6e6617d05c5b487fb5fb663b3ad1226d242886ed6149725f9a84f4d66a6fa9d5

Observation 3ac0fd5d-705d-4259-9f12-a93c0077f143 · outbound

This paper cites Llama-adapter: Efficient fine-tuning of large language models with zero- initialized attention.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model Llama-adapter: Efficient fine-tuning of large language models with zero- initialized attention

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T19:21:15.362341Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-12T19:21:14.757392Z digest=sha256:d56b6f3517e1f4649a5ca16a05910b18ff510006b5d8953db6264106704aa4eb

Observation a467bd66-ca9b-4b1a-99ec-a406103992d5 · outbound

This paper cites SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.761490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.761490Z digest=sha256:9da449a1c52f8dd229c91e1b38412d89431764ba98ffc189ba3f07e6bc14dca8

Observation 0c738d7b-faee-466a-92d7-1fe9f50bc749 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-12T19:21:14.766061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:21:14.766061Z digest=sha256:1473f28966bbd60dad17135f2d7b8a4640eac149d67e78a9693c9c76b160322e

Pith citing papers

Observation 9f142b27-cac9-4666-a592-a5452ab23db9 · inbound

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models cites this paper.

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-23T00:02:17.821582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-22T23:58:57.819555Z digest=sha256:30d117d8ceb2530e08d13999a11608c6ffa351887f9e3b87bb1eb9d9a0d47dbc

Observation 83320cf7-427f-47a2-9850-377bd67ebdbb · inbound

Nature's Insight: A Novel Framework and Comprehensive Analysis of Agentic Reasoning Through the Lens of Neuroscience cites this paper.

Nature's Insight: A Novel Framework and Comprehensive Analysis of Agentic Reasoning Through the Lens of Neuroscience Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 274

Resolution
unresolved
no resolver link, observed 2026-08-15T23:31:12.932387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:31:12.932387Z digest=sha256:345a2242e18c4372812190ecf27c2820492a573dc38daa07447c796a30eb4885

Observation 2af17887-9523-4eef-99ba-52009acf4f1a · inbound

Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning cites this paper.

Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:15.924724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:48:15.924724Z digest=sha256:39edd896cfdedc9ae4706a57c25c9533c880d0efb175c77b5b7a2be78e2c7bd8

Observation 6ba2346a-6f98-45c9-a41c-80c1c81e0659 · inbound

Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models cites this paper.

Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:43:02.340523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:43:02.340523Z digest=sha256:dee91750fd5618d67b245b53e42c174cb872e3380b0ddbc1575d75777ba2b4dd

Observation 6b97be4f-8fef-4016-847b-682b060c615b · inbound

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs cites this paper.

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T12:06:25.772527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:06:25.772527Z digest=sha256:ae6d45f74b607fa41f0cd88ac56c11f4416b84a892a986a4e904a71df7f1f49d

Observation 731567cb-7de2-446a-b222-3b662f87a2da · inbound

Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs cites this paper.

Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T04:20:31.753984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:20:31.753984Z digest=sha256:ace7afd25884e66e09d13be1f40686c28cb3c2a522ce69ab60e45c7d9bfc025a

Observation 762b43ab-b672-4b1b-b4ac-cbd32c5250f7 · inbound

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models cites this paper.

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:42:53.668156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:42:53.668156Z digest=sha256:28ab9a4e2421e720c0d564fabfba9acf3beacb4df40112148dc230c395673444

Observation a8c4a900-5f2d-47c0-821f-41283f54c042 · inbound

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs cites this paper.

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T22:24:29.549834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:24:29.549834Z digest=sha256:5a6823e249fec9be3fedf88e8b86af3853434123c2bf89e0c454ca846eb234db

Observation d0eca418-d976-4faa-adc6-75a5568b58d2 · inbound

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models cites this paper.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:03.452277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:03.452277Z digest=sha256:976bc30a0bb6cd23178b57062349d631d75d34b67376bc6e3074dd7f31caf389

Observation 3ddc02e1-1c64-435e-a3f3-29e50eaa25fb · inbound

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models cites this paper.

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T05:51:15.987225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:51:15.987225Z digest=sha256:24c0e02e4ea3e25fb70f5a3caf28238f8f32033e7672669d71bec5d1b42b1a84

Observation dcff0bad-9c40-47ae-9458-c26b0d523365 · inbound

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression cites this paper.

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-21T15:10:16.490773Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-21T15:09:25.818449Z digest=sha256:f79163aaa54aa303b98be83b9e946757fa905e7b4628bd306248744235b036ed

Observation a264c7a1-7d9c-4008-99ed-4e807bc9dd5a · inbound

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models cites this paper.

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T02:57:46.086957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T02:57:46.086957Z digest=sha256:238caf27cc54bad75bed8ff419da2667f95780e39ac231c3f86001d41b1fd831

Observation c04c2190-6cf4-4248-a223-772acb2fbd56 · inbound

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models cites this paper.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.920542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:edd515279f927e7db094492c712b01e54e79a8444bb68148ee08dfbb2755b99d

Observation 9d97cbca-ed4a-4607-b337-de37b2c26d8e · inbound

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs cites this paper.

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:41:04.436181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T15:23:08.671342Z digest=sha256:2dfbaef444deaf780a061933e06f6ca144bba3f3eebdad195512c97418a668cc

Observation e536b025-dadf-432c-896c-4eeb897aa608 · inbound

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling cites this paper.

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:01:49.121922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T07:00:36.870817Z digest=sha256:99f58293636d84cffecbc3ce915eceb889c8ebdc01dae620d19d5b85e2ac48a6

Observation e35a6860-e50e-4911-b3a9-e07247782165 · inbound

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing cites this paper.

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:58:24.845055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T14:53:57.376715Z digest=sha256:2cd9d1bf44f07e2585ed3a1e27a41e7085cb3fba8c19fd5de5c8260f6160e834

Observation 2adc0b12-fb7d-4065-999e-67083037bda7 · inbound

Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference cites this paper.

Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:43:23.798277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T07:43:18.828740Z digest=sha256:e2d875a7349de0786f8aa42340c4f48ee1d52c4d7b80ddec2b1dfe3d4a7bbea1

Observation 5eaa3acb-9858-4fa4-8e60-b1bc9710040d · inbound

EarlyTom: Early Token Compression Completes Fast Video Understanding cites this paper.

EarlyTom: Early Token Compression Completes Fast Video Understanding Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:23:15.629708Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-29T08:16:02.536341Z digest=sha256:4cbd643346548de3eca2b9cd8ae6f074f7d83672672f670b8d31279a371180f1

Observation 7b92e2ef-7f1f-4dde-83e9-3d2bcd497210 · inbound

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding cites this paper.

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:23:15.866979Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-29T08:13:42.526597Z digest=sha256:9571b2bde89c751f0f902fe8f45dc20081d2f114ec5947a42fea26b73e6c5c7f

Observation 4c9a07ee-aa4e-4607-95e9-d6b945e612eb · inbound

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models cites this paper.

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-07-03T11:28:04.147290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-27T09:35:24.118536Z digest=sha256:cdaff88e0f16f2c4621845dbefb846fd097cfabe66d984c46ffc0dabdaf3feb2

Observation 78b96a77-ebe3-4938-adc2-b267a4e911e4 · inbound

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference cites this paper.

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 52

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T14:09:53.787431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-06-26T04:24:38.917137Z digest=sha256:4a9b23fe2f7d7b4ba3bf6170e2c6f7c1f63346b10275740dcc6511955e4845f0

Observation c222cc31-d96b-440e-80bd-170880e2e2bd · inbound

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs cites this paper.

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:15:44.621408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-01T05:41:04.184461Z digest=sha256:dd6807a26cd35530ec8df2fd1b5ad4b1f147ffc60de24ef4e86b5aed5aae0a69

Observation 13493d25-1882-4ac2-9c22-5251d778b29b · inbound

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models cites this paper.

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T05:03:26.664752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T05:03:26.664752Z digest=sha256:8390863082da9caa1830f7f3c25232f9411561d78bd33f6b2b7080fa0681bf21

Observation 2cac17e1-2c7a-41fb-9ea6-fe26463ff5d8 · inbound

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference cites this paper.

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T03:42:14.989028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T03:42:14.989028Z digest=sha256:77100c73862f9cc2397c339c4e26a5ee55ee60a2a8e0d926ae8e5cfd2e5a3ffa

Observation 6d05624f-a8bc-480b-9d30-1829bd76b99e · inbound

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models cites this paper.

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T01:26:50.559182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T01:26:50.559182Z digest=sha256:23b88384663deebcb029aee50074290ae5e747134059616b421e2d5ddfe5a94b

Observation 56ac6f38-9978-46a6-aff6-7293d6157dac · inbound

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs cites this paper.

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T17:23:16.283827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T17:23:16.283827Z digest=sha256:f77efabe7724fc2f4ff5e70060ab6f1d028c96710b9ea487e49514e05cbbcb60

Observation a2aee47a-d6c7-43da-bbc9-29666f38fb20 · inbound

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models cites this paper.

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-15T14:57:56.439046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T14:57:56.439046Z digest=sha256:eb9772ab8e341d26f9e93d6e5510779cdb9092c931e648c29c22e67d8d34b73d

Observation a8bd15c3-4ac0-4d71-9160-9ad85923ffd8 · inbound

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models cites this paper.

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T16:41:28.857602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:41:28.857602Z digest=sha256:fb6cdbfb45ed734e0805035f0d4a4a0d97636e10ff8aef6b4f22407bdc17a559

Observation b888b749-faa7-4be3-b08e-3024b0e967d0 · inbound

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin cites this paper.

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T04:30:14.292670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T04:30:14.292670Z digest=sha256:61b9ff0e9fdcf0be431d150a50bffb0f48989d79b0efb648e9cb4bb3218d0710

Observation f395aee9-5bdd-4512-9f45-d0f050a073f6 · inbound

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs cites this paper.

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T14:33:14.961340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T14:33:14.961340Z digest=sha256:e6f720bb9d88512dd624d461b2f54559c7ff11b3d2cf2291d94864bfea258d49