Pith. sign in

Paper Citation Record · LEDGER

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2411.10803.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.10803 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 25 of 25 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:43:02.340523Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T14:09:53.785860Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 9f142b27-cac9-4666-a592-a5452ab23db9 · inbound

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models cites this paper.

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-23T00:02:17.821582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-22T23:58:57.819555Z digest=sha256:9b63462122a818fcd790819fbda7ce29456b97fa6d906e2fa837f4dc376599b4

Observation 6ba2346a-6f98-45c9-a41c-80c1c81e0659 · inbound

Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models cites this paper.

Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:43:02.340523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:43:02.340523Z digest=sha256:c389f425e3544f5db8ebca07839f986033b3d979653c1372ddd6427887d5bcfb

Observation 6b97be4f-8fef-4016-847b-682b060c615b · inbound

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs cites this paper.

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T12:06:25.772527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:06:25.772527Z digest=sha256:a489ff6730f38d622f98df5bc158f5499bd5136060900a7b09956fceaaa22ef4

Observation 731567cb-7de2-446a-b222-3b662f87a2da · inbound

Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs cites this paper.

Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T04:20:31.753984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:20:31.753984Z digest=sha256:09ac49464ca4b0f9f33ef509b4c547534f71077aaffa49316708a1c51457c256

Observation 762b43ab-b672-4b1b-b4ac-cbd32c5250f7 · inbound

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models cites this paper.

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:42:53.668156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:42:53.668156Z digest=sha256:d3bff9aa2e9d20f0d073e7423c5fb06be94d76d91b82e293e045dc756e7b1258

Observation a8c4a900-5f2d-47c0-821f-41283f54c042 · inbound

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs cites this paper.

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T22:24:29.549834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:24:29.549834Z digest=sha256:4587d10d754cd60e872fcc372ee7b26dd625fbe92cf679a881baf3fad037ea4d

Observation d0eca418-d976-4faa-adc6-75a5568b58d2 · inbound

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models cites this paper.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:03.452277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:03.452277Z digest=sha256:6e0cdadeceadfaca122b2dc8cfe87aa671488a4de372354f0186ac9e48382adc

Observation 3ddc02e1-1c64-435e-a3f3-29e50eaa25fb · inbound

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models cites this paper.

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T05:51:15.987225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:51:15.987225Z digest=sha256:85ad62eb74cf2b0f2738d1038fc1c76b4ecfc0d844c16e1d11077fc4599a000a

Observation dcff0bad-9c40-47ae-9458-c26b0d523365 · inbound

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression cites this paper.

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-21T15:10:16.490773Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-21T15:09:25.818449Z digest=sha256:4849cc824a01c9ed41fb7c48b524f8719a22341969e3f4d33ce8e2e9afd8a47a

Observation a264c7a1-7d9c-4008-99ed-4e807bc9dd5a · inbound

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models cites this paper.

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T02:57:46.086957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T02:57:46.086957Z digest=sha256:be6cd734d31cb03deb08ed5b30f15856e9cafef9db270f8f29c1623ce69f5f4f

Observation c04c2190-6cf4-4248-a223-772acb2fbd56 · inbound

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models cites this paper.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.920542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:0b5cd85c7190037cd1600829c96569928a492200f83e996b7a611302e2545351

Observation 9d97cbca-ed4a-4607-b337-de37b2c26d8e · inbound

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs cites this paper.

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:41:04.436181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T15:23:08.671342Z digest=sha256:874e86b8cd7c052eac3b5532dff68a897271adb2984114c6647d7518dee9ca15

Observation e536b025-dadf-432c-896c-4eeb897aa608 · inbound

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling cites this paper.

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:01:49.121922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T07:00:36.870817Z digest=sha256:25c7cbf1e11d0c2197931d7c54188db762f303465a348487f5391c8017920879

Observation e35a6860-e50e-4911-b3a9-e07247782165 · inbound

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing cites this paper.

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:58:24.845055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T14:53:57.376715Z digest=sha256:646fedf660cd7d82190b3f6bcc8f844bcf3477561437a83fd8e84c06624930cc

Observation 2adc0b12-fb7d-4065-999e-67083037bda7 · inbound

Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference cites this paper.

Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:43:23.798277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T07:43:18.828740Z digest=sha256:a55b3de6a7d2f717794acdbad19c10e9f2c0e70c03029e3b939fccd3872ad723

Observation 5eaa3acb-9858-4fa4-8e60-b1bc9710040d · inbound

EarlyTom: Early Token Compression Completes Fast Video Understanding cites this paper.

EarlyTom: Early Token Compression Completes Fast Video Understanding Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:23:15.629708Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-29T08:16:02.536341Z digest=sha256:39ff9041045b866393ffc6b8532dbb3b086d595417373d38a295d6898e574466

Observation 7b92e2ef-7f1f-4dde-83e9-3d2bcd497210 · inbound

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding cites this paper.

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:23:15.866979Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-29T08:13:42.526597Z digest=sha256:a477e537a3cca90740671265438d5d34b10d5840bb6496423a27c49b607500e5

Observation 4c9a07ee-aa4e-4607-95e9-d6b945e612eb · inbound

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models cites this paper.

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-07-03T11:28:04.147290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-27T09:35:24.118536Z digest=sha256:261a86a3e181e0154141662059c5926bc7f53cc305be8635898b53234e8428f7

Observation 78b96a77-ebe3-4938-adc2-b267a4e911e4 · inbound

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference cites this paper.

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 52

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T14:09:53.787431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-26T04:24:38.917137Z digest=sha256:e6b7a09dd30ddf4314c4dff829d81dfed48e579ff2bb6ed2bf36d46af26af5cf

Observation c222cc31-d96b-440e-80bd-170880e2e2bd · inbound

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs cites this paper.

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:15:44.621408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-07-01T05:41:04.184461Z digest=sha256:37f9a85d95b4995258de46c6cab02db6dce06aa55cdc92f4cf7de9cda7371bc9

Observation 13493d25-1882-4ac2-9c22-5251d778b29b · inbound

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models cites this paper.

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T05:03:26.664752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T05:03:26.664752Z digest=sha256:56388fcf0fe44fe41f673acfac31310c8f337bf4276005fb93446c190814ddef

Observation 2cac17e1-2c7a-41fb-9ea6-fe26463ff5d8 · inbound

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference cites this paper.

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T03:42:14.989028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T03:42:14.989028Z digest=sha256:747daef781e9f2819a4f45956035f34b32e3d074c83e865de4a3916453591736

Observation 6d05624f-a8bc-480b-9d30-1829bd76b99e · inbound

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models cites this paper.

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T01:26:50.559182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T01:26:50.559182Z digest=sha256:cea75378ecaacd76630ac3aa9e76d64115eedad9ed7a81b136f436133d8b7cf0

Observation 56ac6f38-9978-46a6-aff6-7293d6157dac · inbound

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs cites this paper.

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T17:23:16.283827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T17:23:16.283827Z digest=sha256:d6f541d7d8d239e30d334cdcaa3aee0f3260a7f8e4fb88079ea746ba0bd82d6d

Observation a8bd15c3-4ac0-4d71-9160-9ad85923ffd8 · inbound

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models cites this paper.

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T16:41:28.857602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:41:28.857602Z digest=sha256:430e40764ac910cc586ea24a582f73918da56326707535f4589eef66d8ea98ca