{"as_of":"2026-08-13T00:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edfb4ade5cadacff931f80f3c0c2018a2443cca1d88b14f6ccd0be3715f116ac","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:03:30.238634Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13500/citation-record","integrity":"/paper/2607.13500/integrity","json":"/paper/2607.13500/citation-record.json","paper":"/paper/2607.13500"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T05:03:24.436267Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.436267Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:18a67d77e4ea1aaf39f56b720ce4745c0ffe05bd92dd82f850c5f74ea65a6e2e","observation_id":"f4ab3642-ce73-454d-b2c0-611e1b14a6c4","resolution":{"observed_at":"2026-08-02T05:03:24.436267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:24.536860Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.536860Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:a9f0bf825ac558780f4597fdb78f025b69af08f1a894517ea4d8488a94f48186","observation_id":"c9847a69-a0ba-41e3-afb5-90c2ec4a0642","resolution":{"observed_at":"2026-08-02T05:03:24.536860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T05:03:24.689482Z","title":"Qwen2- VL:enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.689482Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:828a32aa6011f1a01ebbf5a153c86297f7261aa16a75dcf685db429cbac18cd6","observation_id":"226cf9b0-c893-49a1-bc4f-2e0510e1024a","resolution":{"observed_at":"2026-08-02T05:03:24.689482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:24.814141Z","title":"BLIP- 2:bootstrapping language-image pre-training with frozen 11 image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.814141Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:37e9dbb7a4fc6f2bce2c0c10dbf164d257e9db1490ee358f4dae8d94215258e9","observation_id":"ea241e75-2bb5-4ef9-b833-a0bc3a062b41","resolution":{"observed_at":"2026-08-02T05:03:24.814141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:24.897278Z","title":"Cost-efficient and secure federated learning for edge computing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.897278Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:c6bea6f522db08f497fe2f1c8b628039353ea8cf936cc82b997b59c87a064c39","observation_id":"9b2ade47-0381-4662-9bb0-0a2d01c718ef","resolution":{"observed_at":"2026-08-02T05:03:24.897278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.037156Z","title":"To- wards online privacy-preserving computation offloading in mobile edge computing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.037156Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:c170d09718e702c7ed445dc4b7ba8c159edb8e9bce4ed76a276c6fe00e9f375c","observation_id":"0dbdf4ac-b3dd-40f0-9467-1989ec35030a","resolution":{"observed_at":"2026-08-02T05:03:25.037156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24773","last_updated":"2025-08-20T08:08:03Z","snapshot_observed_at":"2026-08-09T09:03:37.562748Z","submitted_at":"2025-05-30T16:35:32Z","title":"AFLoRA: Adaptive Federated Fine-Tuning of Large Language Models with Resource-Aware Low-Rank Adaption","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24773","snapshot_observed_at":"2026-08-02T05:03:25.152278Z","title":"Aflora: Adap- tive federated fine-tuning of large language models with resource-aware low-rank adaption,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.152278Z"},"links":{"cited_paper":"/paper/2505.24773","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:9a9d2f09b771acc9714d3dda6bc97adea128b893c121a91c06663c46a48893cc","observation_id":"c110d243-9905-40b3-a029-e4f09786feb6","resolution":{"observed_at":"2026-08-02T05:03:25.152278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.325447Z","title":"Towards efficient edge learning for large models in heterogeneous resource-limited environments,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.325447Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f7ed5f21452ad7fa3f8050ed37d12cc7a1897cbbd2565117e020cc851757b4dd","observation_id":"54509875-4356-453a-92fd-965ad18dd9bd","resolution":{"observed_at":"2026-08-02T05:03:25.325447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.434759Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.434759Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:99250f377a023354431e21e76d5ee160755aabca475c5e262029517bc71dc112","observation_id":"62585956-b6f2-4224-b033-c57ae6dbf983","resolution":{"observed_at":"2026-08-02T05:03:25.434759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.501494Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.501494Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:9aa8a0a66a648a47fdf14ccffd25b2fd62e73709578e763350c543d7e149d110","observation_id":"1e4c373d-8840-48a8-b27f-9bdcb9d49091","resolution":{"observed_at":"2026-08-02T05:03:25.501494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.611352Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.611352Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:2b0c44fef367bc2cbf4152521bc38eb2a55177b07ac84726f64b56480363c732","observation_id":"b0e52ff1-b723-42a7-a6ba-b6613a029b58","resolution":{"observed_at":"2026-08-02T05:03:25.611352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.794944Z","title":"Tap-vits: Task-adaptive pruning for on- device deployment of vision transformers,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.794944Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:772277b75fc857e6c575d60fc2ed52d13185d34f63e462447b0a9275593b399b","observation_id":"b3c0b6c8-aa10-4928-92c3-7aefb0c0232c","resolution":{"observed_at":"2026-08-02T05:03:25.794944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.924755Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision- language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.924755Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:2a20f8a53e324ce521c91590a42c6c33d72fdace3676f48cd45198f15bb25d2b","observation_id":"4d088e23-6195-4a16-bcc8-5d894330ded2","resolution":{"observed_at":"2026-08-02T05:03:25.924755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.059229Z","title":"VScan: Rethinking visual token reduction for efficient large vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.059229Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:7945ad1a9b08bb56257f8518f03b4fdeb9e1d27e4df2af97c5db0d27099f3d46","observation_id":"f5b2543d-5b97-41a7-82d5-84b2e311bc4e","resolution":{"observed_at":"2026-08-02T05:03:26.059229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.144959Z","title":"Adaptinfer: Adaptive token pruning for vision-language model inference with dynamical text guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.144959Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:bff1dc364940886c2b303802aee442078de24b8184763b36deca7fdbd47f90dc","observation_id":"064b0bc9-7083-443c-8844-053fe9866142","resolution":{"observed_at":"2026-08-02T05:03:26.144959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.344745Z","title":"Variation-aware vision token dropping for faster large vision-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.344745Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:519741a94d5dc0a58bf9ed2c63aa1979c0da5b42c2e049a05c64de019242f974","observation_id":"7fc6fe26-451d-44fc-84b4-94e73926579c","resolution":{"observed_at":"2026-08-02T05:03:26.344745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.444741Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.444741Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:0bd16352befc88d23e4564b0594b9e186958160e3a3fd30fdd4c3f518bb3296d","observation_id":"b7a58740-0054-4df7-bbdd-43b100638dd8","resolution":{"observed_at":"2026-08-02T05:03:26.444741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.552698Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyra- mid visual redundancy reduction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.552698Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:1239b45ddbae8d24d56831a5382cf795ffa6497a76fab44b603b4f11b88e7f15","observation_id":"6e3d6150-0858-4287-b4a9-ec64c80658be","resolution":{"observed_at":"2026-08-02T05:03:26.552698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-12T19:14:46.493618Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T05:03:26.664752Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.664752Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:c07e116bab291c9312eddf96f50e095af693c136bee481c3cbaf94fa70fcdfab","observation_id":"13493d25-1882-4ac2-9c22-5251d778b29b","resolution":{"observed_at":"2026-08-02T05:03:26.664752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-08-02T05:03:26.782904Z","title":"Lightvlm: Acceleraing large multimodal models with pyramid token merging and kv cache compression,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.782904Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:a6c592168b6a3e52666cf4d7376a61acb5a4cc3674b564618914f612e69eb0da","observation_id":"d13bbfb4-1f49-43db-b16c-80d33edd3730","resolution":{"observed_at":"2026-08-02T05:03:26.782904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.870445Z","title":"Visionzip: Longer is better but not necessary in vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.870445Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:76e45ac9ffa75f472580751876c4de0bd0fa6af54a8f1a125b820887eec49d41","observation_id":"0ff3eba6-3f51-43f7-a7fb-97b6a2b91979","resolution":{"observed_at":"2026-08-02T05:03:26.870445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.948681Z","title":"Beyond text-visual attention: Exploiting visual cues for effective token pruning in vlms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.948681Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:b571c107e3b49d6b2879f4b95f7cb9099775cdff8c8b6b50b904fbbb20b60840","observation_id":"b084ba45-397d-4a07-89af-fc30c640744a","resolution":{"observed_at":"2026-08-02T05:03:26.948681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.092271Z","title":"Flashat- tention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.092271Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:2921a1427b9a9f863a37ab49e5182c9b658efd73690cc8f870bf5fb5470326e5","observation_id":"546ee96d-be61-4ad7-84d2-45d3f3cbd165","resolution":{"observed_at":"2026-08-02T05:03:27.092271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.234826Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.234826Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f04a57cb5f126b165c9b4ca1dca875648585d689ffefa330586be32403522706","observation_id":"2deb5366-dbe8-4b57-bbb0-61b467999fb5","resolution":{"observed_at":"2026-08-02T05:03:27.234826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.403994Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.403994Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:e2e8a637deea5e684fbb1a426aba3e0a6319579881dc2734502dfe5644bf66e6","observation_id":"cc87243f-39eb-46ac-bcda-da8422f6b7ce","resolution":{"observed_at":"2026-08-02T05:03:27.403994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.538342Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.538342Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f47667db5489dbe50d47f72e4830c54e5545248b0895c316d1f9b15d924205dd","observation_id":"59915c0f-7492-4139-8a10-0ad3127b019b","resolution":{"observed_at":"2026-08-02T05:03:27.538342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11549","last_updated":"2025-03-14T16:12:23Z","snapshot_observed_at":"2026-08-07T17:03:30.811010Z","submitted_at":"2025-03-14T16:12:23Z","title":"Similarity-Aware Token Pruning: Your VLM but Faster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11549","snapshot_observed_at":"2026-08-02T05:03:27.630859Z","title":"Similarity-aware token pruning: Your vlm but faster,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.630859Z"},"links":{"cited_paper":"/paper/2503.11549","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f2c21e51517b5be1cf924ce881f11bec3143a78afa2f026e5f9be577cfcea1af","observation_id":"9774a8cb-bf6f-4697-814e-07c4097cb51e","resolution":{"observed_at":"2026-08-02T05:03:27.630859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17040","last_updated":"2025-05-10T22:42:28Z","snapshot_observed_at":"2026-08-07T15:59:46.382695Z","submitted_at":"2025-04-23T18:38:18Z","title":"DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17040","snapshot_observed_at":"2026-08-02T05:03:27.729468Z","title":"Dymu: Dynamic merging and virtual unmerg- ing for efficient vlms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.729468Z"},"links":{"cited_paper":"/paper/2504.17040","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:6efd5eccce7a27bd642c015b83579b4ffdc4cf99cd7eaf174430b0ad81f818ec","observation_id":"22517f44-5ec4-418c-aa52-cf96dcdb49a2","resolution":{"observed_at":"2026-08-02T05:03:27.729468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.825305Z","title":"Holitom: Holistic token merging for fast video large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.825305Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:bfb7aa6bbd6feb5d7b445ecbd59c164291167e38cbaebbd910b5b3336b4bd120","observation_id":"3d64b4bf-0c8f-4592-af83-ac3c21952221","resolution":{"observed_at":"2026-08-02T05:03:27.825305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.926783Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.926783Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:2818abcd0477deba7859c069205b7c7ccc9a53e7eebc6efe2a9226bc5467de81","observation_id":"5205495b-aa63-4cf8-b571-2f04b3603e2c","resolution":{"observed_at":"2026-08-02T05:03:27.926783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.013830Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and- language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.013830Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f28168a80826bed95cbdc250e62f40f748d8f6d61f70f48939c920a1b98f7720","observation_id":"87784a5b-205f-46f8-b004-c1470cc9e687","resolution":{"observed_at":"2026-08-02T05:03:28.013830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.121689Z","title":"Uniter: Universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.121689Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:2edf5844f6c85fa6bb31837abec3da7ceb5c2fa75c4c12b4cafcf2832b182368","observation_id":"be0da18c-1d61-449f-9964-be0b68b85197","resolution":{"observed_at":"2026-08-02T05:03:28.121689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.226288Z","title":"Vflowopt: A token pruning framework for lmms with visual information flow-guided optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.226288Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:5620385979120bc9c3bcf57f11a2c866f8954ddea908bae064c668595ce7da56","observation_id":"d8089c62-c843-492d-ad37-af8967cc2be0","resolution":{"observed_at":"2026-08-02T05:03:28.226288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.371847Z","title":"Hidrop: Hierarchical vision token reduction in mllms via late injection, concave pyramid pruning, and early exit,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.371847Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:7372a4a15b4a325f09799c62505f743f413fe9a696424326dee1c22d4be8cee1","observation_id":"6dd0f4b1-427a-4618-b40c-39e40a799b4a","resolution":{"observed_at":"2026-08-02T05:03:28.371847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.468713Z","title":"Todre: Visual token pruning via diversity and task awareness for efficient large vision- language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.468713Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:e47a61bfa5aaa012193159524a56d04ca5706f18afa4c19a7deb7c0ca45f77de","observation_id":"4e8aa322-7b15-44e8-bcba-029479783c31","resolution":{"observed_at":"2026-08-02T05:03:28.468713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.594759Z","title":"Tamp: Token-adaptive layerwise pruning in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.594759Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:b3728e5ea4dfce0a9355ddb7a95e9e29f2071bc1ed4984093717005467e86d12","observation_id":"c635a1e2-7d3a-4d3b-8cb3-6c77aa6b9dab","resolution":{"observed_at":"2026-08-02T05:03:28.594759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.694745Z","title":"Swiftvlm: Efficient vision-language model inference via cross-layer token bypass,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.694745Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:7998ea387caa77eb524ce2d24fe464fce7f0112b7efcf4a80ef8d0b5cea50a2c","observation_id":"c19994dd-9808-4d3f-8bd0-6836fccd94db","resolution":{"observed_at":"2026-08-02T05:03:28.694745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.821960Z","title":"Fit and prune: Fast and training-free visual token pruning for multi-modal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.821960Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:899fb942320cd695d75420914ae941eaedaab0fc3e2b4af490cc8cdf6b189f42","observation_id":"132bf8bb-d0dd-40d9-96a0-259f560bd421","resolution":{"observed_at":"2026-08-02T05:03:28.821960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.915880Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.915880Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:2f101b8d43cdb43cf6f59b90cfc628fa517e7c09e32b59c551d9b0786a2fbe5d","observation_id":"f5b61b77-33b6-4232-bd3b-dfeaa1c807e6","resolution":{"observed_at":"2026-08-02T05:03:28.915880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.080528Z","title":"Lvpruning: An effective yet simple language- guided vision token pruning approach for multi-modal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.080528Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:8fe85929c2487bd5e35f832551c4bea56c9dd83d5b38928002b36f7de3d583f0","observation_id":"cda51eae-d9b7-4f65-9f58-6e8067fb0f7a","resolution":{"observed_at":"2026-08-02T05:03:29.080528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.165018Z","title":"Matryoshka multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.165018Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:c83a8d23be486097f3329486ee641d54ed44e7df56c18c0e42c99d7ea82e0c3e","observation_id":"1edaa9e9-2c2a-4a06-bcef-5a0127102bd0","resolution":{"observed_at":"2026-08-02T05:03:29.165018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.310156Z","title":"Matryoshka query transformer for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.310156Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:07ec3dd8541e6d034622966226758551b0fbf13c8658211ed747a963ee24d0cc","observation_id":"a558b01d-b723-454a-b8f6-6bbf7e44ee96","resolution":{"observed_at":"2026-08-02T05:03:29.310156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.446041Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.446041Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:47c378909d4403e8d3462db5b0d92bdff0be6c5caf6f5a8036925a3de5d1a30d","observation_id":"089ab825-792e-428a-9c62-f70ae9564a87","resolution":{"observed_at":"2026-08-02T05:03:29.446041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.497826Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.497826Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:fea114cbca120bff7cfb5a19ed7ab1cfe4beef25cfe98d3bbb1940fbce72b2cb","observation_id":"3626fb5f-c1ba-4f9a-8255-a056036adf9c","resolution":{"observed_at":"2026-08-02T05:03:29.497826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.612676Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.612676Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:cbd049c4b9b45cfea9670294dc7786fed9069e730b6f4f4cdb2d2aa8c1d1f565","observation_id":"d2bec4f0-55dc-4e30-8613-937675819682","resolution":{"observed_at":"2026-08-02T05:03:29.612676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.779055Z","title":"Towards vqa models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.779055Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:1bbba638edc70613211d777b919a48d6e336ab36de0c9e5ba848b22e9dd71d78","observation_id":"b00ddbee-7c28-4e7f-ae45-562ce7929f69","resolution":{"observed_at":"2026-08-02T05:03:29.779055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.912039Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.912039Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:83bb52dd3f7cfe25423a67d2dd1c2b44806160fd383f269279ccdc4427f8180f","observation_id":"773bc19c-4e06-4a80-a624-ee3a1a702f9c","resolution":{"observed_at":"2026-08-02T05:03:29.912039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:30.032616Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:30.032616Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:89a1e6d5d6d372101cc3f269d581a35ff86a933187791e0846ef8e1c37254fc3","observation_id":"ddf231ed-aef2-4a71-b883-5cee9fa5a70d","resolution":{"observed_at":"2026-08-02T05:03:30.032616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:30.141140Z","title":"Qwen2.5-vl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:30.141140Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:4fd622ed2cce4da3914d7f59aca53f770174236edaa30a2ddf691b59110f31c3","observation_id":"b11c6af6-3425-4468-a3a1-a874fad95616","resolution":{"observed_at":"2026-08-02T05:03:30.141140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:30.238634Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:30.238634Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f54042300a0d3394330c387442b3dff8d2a395aba71184cad4e066c69add528e","observation_id":"71ae835d-ec1b-4842-9824-74af18c345bd","resolution":{"observed_at":"2026-08-02T05:03:30.238634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2607.13500."}