{"as_of":"2026-08-10T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25bb60cf9206e0b083eb1c6073f0af4215367f46336bb4cf79c05ecaf5d4abd7","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:42:16.353153Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16326/citation-record","integrity":"/paper/2607.16326/integrity","json":"/paper/2607.16326/citation-record.json","paper":"/paper/2607.16326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:13.962870Z","title":"A survey of state of the art large vision language models: Benchmark evaluations and challenges,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:13.962870Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:b256ed02e721b6c9c2e754cd69c983d4baa0fb1e7aae2e60d8a4204375e70ed5","observation_id":"22e10980-24c3-4109-b9ec-fe6d9a67ee10","resolution":{"observed_at":"2026-08-02T03:42:13.962870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.029230Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.029230Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:f698ab28dfe1841f56bab1dd1437af00373b2eb9b1d3ce240e6ee276ea811679","observation_id":"a2e7303d-8d63-4d0b-a2ec-b2d66a03a22c","resolution":{"observed_at":"2026-08-02T03:42:14.029230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.088093Z","title":"[cls] attention is all you need for training-free visual token pruning: Make vlm inference faster,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.088093Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:4024ee2d807d49ec0b339e6fc23cafa4b1d63a41c1e18c1cf88299ebc38e99b3","observation_id":"ffc841a0-501a-4e7a-8a12-df7467060223","resolution":{"observed_at":"2026-08-02T03:42:14.088093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-08-08T00:45:20.646947Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-02T03:42:14.167493Z","title":"Stop looking for important tokens in multimodal language models: Duplication matters more,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.167493Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:a1179774b1e265ce102fac784ae58f29ce8e6cf5a777691a4b6c18a0edd4d5bd","observation_id":"cb80ec59-6fda-4a39-a281-9eb459c21c3f","resolution":{"observed_at":"2026-08-02T03:42:14.167493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.225585Z","title":"Visionzip: Longer is better but not necessary in vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.225585Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:5987ff36a4aecf0854600409e721cdb4c94e44e758c63634a1afd137b34a2bf8","observation_id":"fcb18766-f096-4f16-9ae0-344f2ddf65fd","resolution":{"observed_at":"2026-08-02T03:42:14.225585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.268413Z","title":"Divprune: Diversity- based visual token pruning for large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.268413Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:e859b5734de8a266cc4f949abebe12aa4c031accde9a98f740317399167c8d32","observation_id":"a3f840ac-ea02-43e2-9cf5-8fcc758c8011","resolution":{"observed_at":"2026-08-02T03:42:14.268413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.328001Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.328001Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:b1fcd46ad0e81ef3f3e0efe3e929c920813f54a6ff18f878e1ea2413668afb81","observation_id":"b2747e3b-6ba8-4f41-84f1-43088a6a4d92","resolution":{"observed_at":"2026-08-02T03:42:14.328001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.387140Z","title":"Which experimental design is better suited for vqa tasks?: Eye tracking study on cognitive load, performance, and gaze allocations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.387140Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:6499ca55c2290e8d72a67a99f0cf067adbcc7e44ab73b547cc21b4df5286ad2d","observation_id":"deb8fc81-c2ea-47af-a648-ca7099b13bd2","resolution":{"observed_at":"2026-08-02T03:42:14.387140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.451408Z","title":"Making the invisible visible: Verbal but not visual cues enhance visual detection,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.451408Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:f4d7c3f6c016edb78a288909a5a507a42bcf1c3540257a7cf1d6898c60fbaab3","observation_id":"cf119c7b-0c1e-4101-8c49-904514bb2413","resolution":{"observed_at":"2026-08-02T03:42:14.451408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.510468Z","title":"Beyond text-visual attention: Exploiting visual cues for effective token pruning in vlms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.510468Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:cea1c1102eb310f5cbdc54b93a2ce89f91c64790dd4a09067f3003d3c0471e02","observation_id":"84348696-6677-4790-919f-ea30c9956231","resolution":{"observed_at":"2026-08-02T03:42:14.510468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-02T03:42:14.568395Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.568395Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:2a661adf560cb3c3d141ccd3f70430a18991a3e8828923ba0265c0b2aa4b29a0","observation_id":"afcfed36-0ac4-44ac-8e3d-7e56bab9427b","resolution":{"observed_at":"2026-08-02T03:42:14.568395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.614845Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.614845Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:fa72baafec02b2944492b3316c4f91b2003240398983ca0e7b91cbe093e7b6ed","observation_id":"a87a12c8-fe66-4e61-b471-5a5b9fb3f6f8","resolution":{"observed_at":"2026-08-02T03:42:14.614845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.672964Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.672964Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:6cfc0191be089ca708aa72368d2411d61ad825aaafb31a1d519c6e46d5724651","observation_id":"0f349ea5-b27c-4a40-aabb-1980a500fb4f","resolution":{"observed_at":"2026-08-02T03:42:14.672964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.747206Z","title":"A-vl: Adaptive attention for large vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.747206Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:524b744084f4df54e5f3562b507c566f7d043336444a594daecfb07b55b7d69c","observation_id":"4b78eb07-ce38-47e4-906f-82d0d86ed7e6","resolution":{"observed_at":"2026-08-02T03:42:14.747206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.810397Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.810397Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:b376bec35992c74c7053da9083dda9170e4393c16eed089d20a14617ed5850dc","observation_id":"43bb17fe-eb23-4fad-ba9e-8ac6e71a801b","resolution":{"observed_at":"2026-08-02T03:42:14.810397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.869453Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.869453Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:9d6a8480110c1096ba2ce667ecd1ab2dd9ab197db1a78683d3c969b4cad087c2","observation_id":"a6c1fd54-da0e-4dc4-85b6-278d6826381c","resolution":{"observed_at":"2026-08-02T03:42:14.869453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-02T03:42:14.917470Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.917470Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:002788c7a720e5f7c9486177bbb01d9ddeeb29d187a1821255d5abc39e9e52f1","observation_id":"7e8570fb-3b5f-477d-a0d0-4f7da959d9b4","resolution":{"observed_at":"2026-08-02T03:42:14.917470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.968369Z","title":"Token merging: Your vit but faster,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.968369Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:2e64210f978ea209a479206f32c08e93d94a01cc7f411255641253a3cc0b560d","observation_id":"e70aee6f-94b2-4f0e-893a-450614b14839","resolution":{"observed_at":"2026-08-02T03:42:14.968369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.973153Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.973153Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:baad356f85071c5a40680256b911212db2f3c19ea8fa760f35fcdfa9cfb720d4","observation_id":"9be3d9bc-25e7-4233-9703-6ef794af667e","resolution":{"observed_at":"2026-08-02T03:42:14.973153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T03:42:14.989028Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.989028Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:747daef781e9f2819a4f45956035f34b32e3d074c83e865de4a3916453591736","observation_id":"2cac17e1-2c7a-41fb-9ea6-fe26463ff5d8","resolution":{"observed_at":"2026-08-02T03:42:14.989028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.064940Z","title":"en core web sm: spacy english small model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.064940Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:8d51f39322df9abb173165a2286eae74583fdde4ae82e060bc494326b90d7ee9","observation_id":"eb6895fa-9c7e-47b1-948a-5c12c1dfccec","resolution":{"observed_at":"2026-08-02T03:42:15.064940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.224141Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.224141Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:f4a6daaf94ecd658f70210cf26f2c24402595d29b5e74fd474014cfed41e4bec","observation_id":"aa5edcd7-3e17-4763-95cc-a265e3619c42","resolution":{"observed_at":"2026-08-02T03:42:15.224141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.385887Z","title":"Vizwiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.385887Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:1751a319cf405d413e1447d1f29ec09f351a8876c9aa0d2979bb3d0b9761ae29","observation_id":"6ee3588a-2ed4-48ec-a572-b6008311a5bb","resolution":{"observed_at":"2026-08-02T03:42:15.385887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.538454Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.538454Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:79a7ffd63d336483efc08ab10dd26383f2532938140869e02928c0b4c8985fc0","observation_id":"0b291d16-1ac2-4445-9add-45ac222e2926","resolution":{"observed_at":"2026-08-02T03:42:15.538454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.652552Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.652552Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:abcb74a4b4f55954ee7b25f3c3a8263f74cbbd94238e8f7cf0c9801e4beebf59","observation_id":"e23e9de6-19a2-423b-9be8-701099206de4","resolution":{"observed_at":"2026-08-02T03:42:15.652552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.811440Z","title":"Towards vqa models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.811440Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:d72ba7d23ba093c9a9b2224caf8f2e97d09bf08b2b134168ceba162e827e4627","observation_id":"6ac73fdb-ead5-4f4c-a603-1df1de942469","resolution":{"observed_at":"2026-08-02T03:42:15.811440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.972178Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.972178Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:43422658603dbafe81431dca2c21b172a86d87731bd2a0de0b81376d6363ec51","observation_id":"a0dc2b26-e124-494d-8b8a-f0c40c015cc9","resolution":{"observed_at":"2026-08-02T03:42:15.972178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-02T03:42:16.140370Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:16.140370Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:89dad889fde265d4088a76a37dcfe9cd10b533c82fd5c1406249a1a25768269b","observation_id":"cf4a3d85-1401-493d-9782-227dffb6d8ee","resolution":{"observed_at":"2026-08-02T03:42:16.140370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:16.307600Z","title":"Mmbench: Is your multi-modal model an all-around player?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:16.307600Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:fa9b297a4d014f19f55268229cd2c10ce021718b9e2424f872db829d847fecbb","observation_id":"9ccc400f-956c-4576-9587-b505246e1706","resolution":{"observed_at":"2026-08-02T03:42:16.307600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:16.353153Z","title":"Mm-vet: evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:16.353153Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:a1f0f03731ce8fa67d9792b1bf4666668fe48b72203d4e985f5cb1f9789469ce","observation_id":"6462f743-c873-4b9f-8e30-c2f19f1637fd","resolution":{"observed_at":"2026-08-02T03:42:16.353153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:18:13.444731Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2607.16326."}