{"as_of":"2026-08-10T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:388971067fa7b7b28cf6e48c5e6c562aa8a2e8ecc825935ff5c62d8c8fb2a804","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:30:14.535753Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06411/citation-record","integrity":"/paper/2608.06411/integrity","json":"/paper/2608.06411/citation-record.json","paper":"/paper/2608.06411"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-10T04:30:14.184628Z","title":"arXiv preprint arXiv:2502.13923 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.184628Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9aa933d6734c125ac8094f7bb97d83e3e3ce7771c1acc5ad5ed5f66fa541f166","observation_id":"d3fefcc0-c1e5-49a9-8b02-7fb1be112d50","resolution":{"observed_at":"2026-08-10T04:30:14.184628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-10T04:30:14.189388Z","title":"arXiv preprint arXiv:2504.10479 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.189388Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e699700544251fb74ddddf38622e356fd96b22a235108a189a76304511588450","observation_id":"5bf4cec4-7fbf-4622-8715-6616263e904a","resolution":{"observed_at":"2026-08-10T04:30:14.189388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.193471Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.193471Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:42db3648ffd171eb6aa83f0b4d48a36afa49cb8053526be7bedf7ddd1fb5f2fe","observation_id":"6613c666-b789-4a1d-ab34-393cc274f899","resolution":{"observed_at":"2026-08-10T04:30:14.193471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.197067Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.197067Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:2d479d8a0a8c3cfec3fd60dd6134b44d78fe410743c5244aae8ff28bac934b37","observation_id":"c552ff0a-8265-45dc-a260-ef63ec3ca58b","resolution":{"observed_at":"2026-08-10T04:30:14.197067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.200763Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.200763Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:6a5344b8950f4ee330f55fdde86c6fb214e1ce8479378e678ce9d5efaa1a10f9","observation_id":"9216dc4a-716e-4300-a6a9-785c5b82ebb1","resolution":{"observed_at":"2026-08-10T04:30:14.200763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.204559Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.204559Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:461f569cc1853f18bc8b9f084774fd92bbef7130caa8a8581e230cab63c3df6b","observation_id":"7f200349-2f41-498c-bbb6-00669a2110fe","resolution":{"observed_at":"2026-08-10T04:30:14.204559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.208606Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.208606Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:7a2bab1acfd6781f5e007310c2dad7831c626398c1dd5e24571db589810fbb1e","observation_id":"655ff2fc-a489-418d-8f29-ccdc15ad5dab","resolution":{"observed_at":"2026-08-10T04:30:14.208606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.211519Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.211519Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:0973becd28da53cc5f127c87a0588d6c28cb5e88f353a3d9fbe9866332f38800","observation_id":"788c189a-8fd3-4e98-b920-0f4319ec14bc","resolution":{"observed_at":"2026-08-10T04:30:14.211519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.214635Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.214635Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9a144efd14bf9c9eee44f0aedb9917545edd3c80fb6b331c5970a52c56947ba5","observation_id":"36222e3f-701e-4743-b392-5722206979a5","resolution":{"observed_at":"2026-08-10T04:30:14.214635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.217581Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.217581Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:a9df88a678d3663bbfe891af995c0533c73d1a123569a8a4305a53d612dd1a4a","observation_id":"caa82ddf-0c37-421f-a9fc-9152b55e2ff1","resolution":{"observed_at":"2026-08-10T04:30:14.217581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T04:30:14.220359Z","title":"arXiv preprint arXiv:2308.12966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.220359Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:39729efe42f4143cb675c4cd681601ace34d3f35021dfa10903f8def79e89743","observation_id":"456cabf5-7ad3-4338-a54b-94098b316d52","resolution":{"observed_at":"2026-08-10T04:30:14.220359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-10T04:30:14.223732Z","title":"arXiv preprint arXiv:2404.16821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.223732Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:55b4d852b3c75c86499a0bc3c959c75bf85e8c8b1bf749b308d562d0ff617192","observation_id":"4a5433c3-b826-4b3f-8dd8-2695fc491d56","resolution":{"observed_at":"2026-08-10T04:30:14.223732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T04:30:14.227340Z","title":"arXiv preprint arXiv:2312.11805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.227340Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:ca0d6172f28e247bf9dd62879e36d2b6c0add1470bb4d6c56a38b272188f964a","observation_id":"e3ed016b-e8d6-4909-8094-f1906e58ba7d","resolution":{"observed_at":"2026-08-10T04:30:14.227340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T04:30:14.230915Z","title":"arXiv preprint arXiv:2403.05530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.230915Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:18f63402c6f23cc6d70cf2be50d628195c505f27926ab144d938c0cafd7943f0","observation_id":"498c2365-7b92-4d8d-a347-8476b14d3987","resolution":{"observed_at":"2026-08-10T04:30:14.230915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.234665Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.234665Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c5c7962ddf052dade0551cdfa29376b2bd212539fbe69bae78893b5db6ff3192","observation_id":"83c95443-0f89-4b8f-b099-9c4efeda70fe","resolution":{"observed_at":"2026-08-10T04:30:14.234665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-10T04:30:14.237915Z","title":"arXiv preprint arXiv:2210.09461 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.237915Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:d1861cb7a410d74b7338f6f06e17490d1d860277afee249e6ee6cb87ca59f2c3","observation_id":"04fcfba3-a3aa-4fc8-be22-c34dbc4866f3","resolution":{"observed_at":"2026-08-10T04:30:14.237915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-10T04:30:14.241516Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.241516Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:1dd2eece437b85d1d88da3d650a3dbf686c7a9b640a766a7bd766f47d7313f61","observation_id":"daddbc57-a323-435e-9fb5-7d783b1be326","resolution":{"observed_at":"2026-08-10T04:30:14.241516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.244923Z","title":"arXiv preprint arXiv:2403.15388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.244923Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:61f5928e12b1783ef307da1ba74bad98b8b7a0302aaa5d0762be94f6032be371","observation_id":"d0f3ba0b-a1e1-49bf-ac40-98a4e7670049","resolution":{"observed_at":"2026-08-10T04:30:14.244923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.248316Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.248316Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9490a4e4a639b0fa7fe0929824ecb883dc670794968d8fc7a3a93691ab1eb6ed","observation_id":"4cd2cbfe-3851-4f2f-9a68-ff4bc8485b30","resolution":{"observed_at":"2026-08-10T04:30:14.248316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-10T04:30:14.251891Z","title":"arXiv preprint arXiv:2312.16886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.251891Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:93e82fad1771446b45f62d43e32a1e240cefd33b90b9a16a6da339276f698197","observation_id":"c2530b53-5a83-4dd9-9946-b4b97b816b33","resolution":{"observed_at":"2026-08-10T04:30:14.251891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-10T04:30:14.255625Z","title":"arXiv preprint arXiv:2407.02392 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.255625Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:0afca3b78676e6facbad509ccd67bc2040dee98460f85a553bf1a0800b4042ef","observation_id":"3c74d0f9-56b4-442e-91c8-51e2e8a3ec73","resolution":{"observed_at":"2026-08-10T04:30:14.255625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.259308Z","title":"arXiv preprint arXiv:2411.17686 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.259308Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:f32fc5f79c292274a60979d0118dde2c52ef8f761700f4650e3445d2aba463d1","observation_id":"5c9d12e3-3039-410b-b995-177db0a4e534","resolution":{"observed_at":"2026-08-10T04:30:14.259308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T04:30:14.263104Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.263104Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c5c1cf0381e8f14f6e13552020662f30bf2ba24f69d239bc93a6f6e0e887e6ae","observation_id":"b05b1e3c-ad65-4f76-a39e-be00825a9b60","resolution":{"observed_at":"2026-08-10T04:30:14.263104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T04:30:14.266859Z","title":"arXiv preprint arXiv:2309.16609 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.266859Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:90821ea2e598a4c4fa5cc85852ceff0ea12076bd2ead72b95c2f592378190684","observation_id":"73fd6f05-f54a-4edf-a71b-92ff8ec78783","resolution":{"observed_at":"2026-08-10T04:30:14.266859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T04:30:14.270569Z","title":"arXiv preprint arXiv:2403.18814 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.270569Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c7ee0775567e259e00c448df032d35eaf3a0569540826f47e08b5d479282f2d8","observation_id":"6ed976d5-52fa-4f87-b350-6d6483148a3a","resolution":{"observed_at":"2026-08-10T04:30:14.270569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-10T04:30:14.274367Z","title":"arXiv preprint arXiv:2501.03895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.274367Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:4618c4e36aa9ef6467992812e0652f139d5bdef9db38c2510c9fe55f97884775","observation_id":"100f7f4a-5ab0-4897-aeac-f15ce15c3ddc","resolution":{"observed_at":"2026-08-10T04:30:14.274367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.278391Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.278391Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:0805e8b75039fbcc45c692d6b33c0185be90d6cbc11fbc02f053b82c4b4363df","observation_id":"51982df7-5667-4d16-8a10-81e67ee8acb4","resolution":{"observed_at":"2026-08-10T04:30:14.278391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.281720Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.281720Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:df0c2126cf9f592c8e702220ae750ad6764a07f7cea90b028b6be17b9b165054","observation_id":"5bc6395f-69e3-4fb0-b1e5-d9efa37ef0cf","resolution":{"observed_at":"2026-08-10T04:30:14.281720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-10T04:30:14.285282Z","title":"arXiv preprint arXiv:2412.01818 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.285282Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:95c40068640ab8680e62a1314f85a2f26f8b6ec696b4dab309a4aa340399348b","observation_id":"6164b773-31a9-42e1-a6bc-7d14aa21dccc","resolution":{"observed_at":"2026-08-10T04:30:14.285282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-10T04:30:14.288837Z","title":"arXiv preprint arXiv:2410.04417 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.288837Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:339e821c9942628c77d390b2377de7e31232b825197416ee7dedc5609a68f544","observation_id":"e270aa12-acc4-49a4-8290-05c05ff6845a","resolution":{"observed_at":"2026-08-10T04:30:14.288837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-10T04:30:14.292670Z","title":"arXiv preprint arXiv:2411.10803 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.292670Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:27af663bc6fcdd9bb387c532959d8c2064329ac16b7e63c863f5e3033873a850","observation_id":"b888b749-faa7-4be3-b08e-3024b0e967d0","resolution":{"observed_at":"2026-08-10T04:30:14.292670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00447","last_updated":"2024-11-30T11:42:35Z","snapshot_observed_at":"2026-08-09T22:02:40.535467Z","submitted_at":"2024-11-30T11:42:35Z","title":"ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00447","snapshot_observed_at":"2026-08-10T04:30:14.296106Z","title":"arXiv preprint arXiv:2412.00447 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.296106Z"},"links":{"cited_paper":"/paper/2412.00447","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c6a50e8f580c1d0a0f75d8c85c04fcada6680dad20c0092df5f3b02d9b92ec3b","observation_id":"5f172363-a22b-4c8d-b29a-583864f922bb","resolution":{"observed_at":"2026-08-10T04:30:14.296106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-10T07:41:21.476174Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-10T04:30:14.299362Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.299362Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:3cc401d6ad186328b8c2985c37a7789fef0f88f73f6a315cf0d5e30f237a91dd","observation_id":"f7e6a82c-d1ad-4b30-9c0c-272f3de478b9","resolution":{"observed_at":"2026-08-10T04:30:14.299362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-10T04:30:14.302724Z","title":"arXiv preprint arXiv:2403.17297 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.302724Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:fefdf32031c8a6f6dccfa4276d025cb4e65b21dbc6ff8147e20f4859a2f2aa16","observation_id":"608d509a-bded-40cb-8ee1-8cb0781c9a7d","resolution":{"observed_at":"2026-08-10T04:30:14.302724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.305742Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.305742Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:bc5a2b85c18c3bec1b90ec7b0b723c0433ac005c12af9b24b6e19770421ebc96","observation_id":"92b9e655-b4f4-4e0a-9a03-f79c0a52089d","resolution":{"observed_at":"2026-08-10T04:30:14.305742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.308686Z","title":"WACV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.308686Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:1d6711e602167538e1716df72af6afef6b6e8ff4bca50bb0a632296a576e0153","observation_id":"aaa4e496-0e8a-42c7-b286-2b822f85099c","resolution":{"observed_at":"2026-08-10T04:30:14.308686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.312135Z","title":"WACV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.312135Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:cc2538b8a1ba3c6fa207fb989ff38336d4deea56a7f44bdbdebc057c197eabed","observation_id":"5cb99119-9302-4632-ba03-ef4f6964d551","resolution":{"observed_at":"2026-08-10T04:30:14.312135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T04:30:14.315460Z","title":"arXiv preprint arXiv:2203.10244 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.315460Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:2944306e4bb9fd162e83f293fc54df477ba87a5d1e0fc19bb988c8205acc3657","observation_id":"678ccdbd-6575-4c75-9c72-c3410921ded0","resolution":{"observed_at":"2026-08-10T04:30:14.315460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.319438Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.319438Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:8d698c5686472b3ae0c53f203d89be0424a5e5182776a6bf27625c13d90893f6","observation_id":"9567cdd9-78a5-40e5-b775-3c853645e88b","resolution":{"observed_at":"2026-08-10T04:30:14.319438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.322726Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.322726Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:073bc958852abaff602b1c1b5a7f9f83eed61f9bd9a6165e80d10d22ec25629e","observation_id":"8060f9d7-21bd-49d3-b775-04767abd0b3a","resolution":{"observed_at":"2026-08-10T04:30:14.322726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.326019Z","title":"EMNLP , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.326019Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:43c796fa2e6ca974090b72c937512282fcb265ac4ac49677e76950a4199f42cb","observation_id":"c9bd4578-b93d-4a31-a85d-2ccab01855f4","resolution":{"observed_at":"2026-08-10T04:30:14.326019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.329346Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.329346Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:efa68303de41ed3ffde13508d80aa661bfd346c09c5e1405e5b8149b814a68d4","observation_id":"27495724-e151-41ce-b800-bc8f69d17a57","resolution":{"observed_at":"2026-08-10T04:30:14.329346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-10T04:30:14.332660Z","title":"arXiv preprint arXiv:2402.03766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.332660Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:70cb8f32642c3532ffc4813c4315d49a35d7a260e7316df40b4fd68f1cb0f007","observation_id":"3c74206c-3482-49aa-93da-85f0681ee83f","resolution":{"observed_at":"2026-08-10T04:30:14.332660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.336324Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.336324Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:5aeafb0cf5e9b39139df3e01cd3cc8108d98ff2647abaad3342aa60d54135abe","observation_id":"8b16f436-314e-4cb7-879a-1c7375f87e85","resolution":{"observed_at":"2026-08-10T04:30:14.336324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.339687Z","title":"arXiv e-prints , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.339687Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:86739eb8a3aa93b031019c6adabce9108474be354bc375bd0aad7b001d465f56","observation_id":"c8e980ba-49ac-46a2-9ef9-9724a899f10d","resolution":{"observed_at":"2026-08-10T04:30:14.339687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.343274Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.343274Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e40cf6527223f30cd68c4100c905769110fca2bad9682a0c046f42a58b7ba301","observation_id":"cc095e69-dfcf-4ff8-96bd-0af283339d9e","resolution":{"observed_at":"2026-08-10T04:30:14.343274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-10T04:30:14.347023Z","title":"arXiv preprint arXiv:2307.02499 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.347023Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:cc52bf42ecc25b2da80bb0b0b577105f104dc7123705930449a67955fe045bbd","observation_id":"d44975fa-5d17-40c0-a7a4-11d836af12bf","resolution":{"observed_at":"2026-08-10T04:30:14.347023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T04:30:14.350680Z","title":"arXiv preprint arXiv:2406.08487 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.350680Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:8fd3166dbd5fbba359f527fcc25f8f3bbad3dac860defc3b39093a33f5ed62e3","observation_id":"0a18acc9-376b-4343-b92c-c026baf70eed","resolution":{"observed_at":"2026-08-10T04:30:14.350680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.354396Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.354396Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:dd03276be77c536e041a6c1f7980a7b6c958456728d1cfb25fd95e5cb7573e27","observation_id":"20e53230-899e-417f-92db-a8dfd19d0703","resolution":{"observed_at":"2026-08-10T04:30:14.354396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.357716Z","title":"ECCV , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.357716Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:96670f702a2bb51c17dd75594906251afb4f712948577d108a0266c284f900db","observation_id":"d406f4c0-480d-4dd0-8802-74a953a56716","resolution":{"observed_at":"2026-08-10T04:30:14.357716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T04:30:14.360982Z","title":"arXiv preprint arXiv:2304.10592 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.360982Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:18f3297f6d06709de9a4e2334c940d80af24889f0d08975204176f0d6a6caba2","observation_id":"ef15e32c-ce71-4f94-aa36-064ccacaabc5","resolution":{"observed_at":"2026-08-10T04:30:14.360982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.364525Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.364525Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:18c81207018291bbda314678736ac32434a795456d1ce9b1ae7ea83c3966ceb2","observation_id":"18ef600a-d58c-4cbe-8cdb-1238e205f75b","resolution":{"observed_at":"2026-08-10T04:30:14.364525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10994","last_updated":"2024-12-17T02:05:27Z","snapshot_observed_at":"2026-07-06T19:16:36.688367Z","submitted_at":"2024-09-17T08:56:27Z","title":"Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10994","snapshot_observed_at":"2026-08-10T04:30:14.367925Z","title":"arXiv preprint arXiv:2409.10994 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.367925Z"},"links":{"cited_paper":"/paper/2409.10994","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:bf4e9da8f88999047537cf47cf26d8298be0cea21451b9e33657261f51b6ebbe","observation_id":"5bbe1032-10e0-43e0-96f6-cb7127e9fa02","resolution":{"observed_at":"2026-08-10T04:30:14.367925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09564","last_updated":"2024-09-20T14:51:18Z","snapshot_observed_at":"2026-07-06T19:15:29.988880Z","submitted_at":"2024-09-15T00:38:34Z","title":"TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings","version":2},"cited_work":{"arxiv_id":"2409.09564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09564","snapshot_observed_at":"2026-08-10T04:30:15.160107Z","title":"TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings","venue":"cs.CV","work_id":"e3bf1087-29f2-4dcf-b6c9-6820541a8ec0","year":2024},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.371579Z"},"links":{"cited_paper":"/paper/2409.09564","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:6e9a881d9edec1851ed9b50b720de939d4b675b4aa09b3dfcd25bcae75d34a71","observation_id":"57db35f6-fe3e-49e7-a9fd-989fbf4a5cde","resolution":{"observed_at":"2026-08-10T04:30:15.167292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-07-06T19:53:47.605701Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14228","snapshot_observed_at":"2026-08-10T04:30:14.375574Z","title":"arXiv preprint arXiv:2411.14228 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.375574Z"},"links":{"cited_paper":"/paper/2411.14228","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b2dc6b10a13c413b549312a8a3f2bf15754666e9cac28bafcde64782d44d49a2","observation_id":"c4bfe39b-061b-4146-86c4-abc0b20949bd","resolution":{"observed_at":"2026-08-10T04:30:14.375574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T04:30:14.379313Z","title":"arXiv preprint arXiv:2403.05525 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.379313Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:31103c33f14cc9a93834ef58735801b4a1b2d623816f964c0b1f047fdf0511f2","observation_id":"72812fb3-2681-4c41-b044-677deb2ad573","resolution":{"observed_at":"2026-08-10T04:30:14.379313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.382832Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.382832Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:ba708437bfa9b0d79638b3aedffab992217c4bd2c6ce7e0a4ff9e48e7b7ab260","observation_id":"b7c065a8-5ccc-4a65-a1a6-4ab6c37f6b8f","resolution":{"observed_at":"2026-08-10T04:30:14.382832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T04:30:14.386155Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.386155Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:f86278ab7a5a32f58d0e922db5ccf058a56a93a1150e93c74b2cb19fec93e8a1","observation_id":"19a85498-d981-42e3-8a41-06ba36b4a12c","resolution":{"observed_at":"2026-08-10T04:30:14.386155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.852459Z","title":"NeurIPS , year=","venue":null,"work_id":"0ebd5f7a-6674-4636-a9bd-f4aca548f8dc","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.390028Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:041ad5c9cd924581d849a37a5a704bcb8b4f20e6981eac15bd810444521c80be","observation_id":"868f1a82-2656-424b-b0a5-40c2d9dde5d3","resolution":{"observed_at":"2026-08-10T04:30:15.856172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T04:30:14.393401Z","title":"arXiv preprint arXiv:2409.12191 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.393401Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:141ec8dee308899fa66730c251a8861a710be05f47df5192746d28902d4087a4","observation_id":"709f01b0-9b09-40de-bf1b-d9a8590fbc55","resolution":{"observed_at":"2026-08-10T04:30:14.393401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.841663Z","title":"ICML , pages=","venue":null,"work_id":"05d26e70-29c4-47de-9199-e9754c1f36c9","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.396351Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b33a7a770629751dc30d19d662dafe273043b7f3165b335419eacff46f53ef5b","observation_id":"444a931e-74ea-4114-b2aa-e45f19f5938f","resolution":{"observed_at":"2026-08-10T04:30:15.845287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-10T04:30:14.399358Z","title":"arXiv preprint arXiv:2412.10302 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.399358Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:062f022a119c27509eabeeb0b263d37e7c13a82f76751e65ac82fdfadb9955ce","observation_id":"d3efd223-49a3-4e6d-b047-506a4b0bddac","resolution":{"observed_at":"2026-08-10T04:30:14.399358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.829591Z","title":"ACM Transactions on Database Systems (TODS) , pages=","venue":null,"work_id":"f818377f-7dc8-4056-940c-3369b04ab79b","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.403709Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:1226efafc1a6788fc506295776a87abce89ea4e8e1751723a54d43edc3d56418","observation_id":"035b1fdb-dc96-40b6-aa2e-e4ddf1c81ea2","resolution":{"observed_at":"2026-08-10T04:30:15.834253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T04:30:14.406724Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.406724Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:6e9c1c97a3e1328a8ecd33fc34d61323e5bd4f66b0be6d2483b973df5077485d","observation_id":"6adf513c-42ee-4652-8ca4-90b192613326","resolution":{"observed_at":"2026-08-10T04:30:14.406724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-10T04:30:14.409858Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.409858Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:23ea541b0118df2aaa7070cb922b49a7eaf34201729deda157d90864aabddb85","observation_id":"b8db08b1-f786-44c5-981b-5861db570550","resolution":{"observed_at":"2026-08-10T04:30:14.409858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.414203Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.414203Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e5fa7cb292ad6b3bfd6d0f459b098c81213339ab8be7b42af939008054ee30b7","observation_id":"2d548e17-b98a-459e-b572-53109317b777","resolution":{"observed_at":"2026-08-10T04:30:14.414203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T04:30:14.417640Z","title":"arXiv preprint arXiv:2407.07895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.417640Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:885849fb03a667a25ae9af9309209809876108f03c95f2ffed8569be33dfd685","observation_id":"4717ca4d-4ce6-4747-b553-94e6f052838b","resolution":{"observed_at":"2026-08-10T04:30:14.417640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.421428Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.421428Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:1b986945d881a00714fd0ddcb743ad57ca293f6f0d28f166c34097414f65b763","observation_id":"7d630164-4544-449e-8ca2-cd2eb7387854","resolution":{"observed_at":"2026-08-10T04:30:14.421428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.424914Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.424914Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:f0e5ccb959e17c04f05c4d39a4541294f805a1fe7c336c62b89371f04306901f","observation_id":"2bc0c6ba-b6c3-4fb4-a600-100a0fafb2da","resolution":{"observed_at":"2026-08-10T04:30:14.424914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.796460Z","title":"NeurIPS , year=","venue":null,"work_id":"e2ccd65e-23ae-4d8b-83d4-7ebaa8c9007a","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.428501Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:cb2e778501d62fa977a257a5963101ffa92e964358c03896041d0957f47640c3","observation_id":"db8c182a-0f84-47e2-98b8-c2c81904cb62","resolution":{"observed_at":"2026-08-10T04:30:15.800164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-10T04:30:14.432345Z","title":"arXiv preprint arXiv:2307.16125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.432345Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:318891d7f9d6db0da9bd170b6fa6cfbc01de73e48690f11cdbd90dc6180280fb","observation_id":"457f16e9-e01a-42bd-a39e-d79d004b12fc","resolution":{"observed_at":"2026-08-10T04:30:14.432345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T04:30:14.436166Z","title":"arXiv preprint arXiv:2306.13394 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.436166Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:645e0a9dd53689650acb074c1dac2e7f04b95bdd2c1ce7a87c6f76f64179530b","observation_id":"e148b1e9-b912-4325-bbd0-0e0adafa7149","resolution":{"observed_at":"2026-08-10T04:30:14.436166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.784402Z","title":"ICCV , year=","venue":null,"work_id":"19834ced-71f2-440c-8616-424e653ac1ac","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.440011Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:2600a9763c8b2a849e9953fa8ca603b6555e33b4ae5e65329f7d6505f06b744d","observation_id":"4f4ca747-1fac-483b-b8cc-40afb9b37933","resolution":{"observed_at":"2026-08-10T04:30:15.788679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19628","last_updated":"2025-07-25T10:41:09Z","snapshot_observed_at":"2026-07-06T19:58:52.773265Z","submitted_at":"2024-11-29T11:24:23Z","title":"Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19628","snapshot_observed_at":"2026-08-10T04:30:14.443529Z","title":"arXiv preprint arXiv:2411.19628 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.443529Z"},"links":{"cited_paper":"/paper/2411.19628","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:df4f295c2d9a363b2c0bf51cd7e0f10b8a8a131638c25681b5bc765b04c0e04e","observation_id":"289f2c93-275c-42ca-99dd-849180301cb3","resolution":{"observed_at":"2026-08-10T04:30:14.443529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-10T04:30:14.447236Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.447236Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9cb3941ce45b207aff59221df88ee274286004a7a715ddcb4fbc05149b56696e","observation_id":"e7414c56-1099-4ff0-8fe4-97423e1612eb","resolution":{"observed_at":"2026-08-10T04:30:14.447236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T04:30:14.450759Z","title":"arXiv preprint arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.450759Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9ab2310bb3642b6d8e988ecf74f30eebb1c47832c9e362e6f919a22710d8e10c","observation_id":"34ee7d7b-0e4d-426e-92b7-98060254abd8","resolution":{"observed_at":"2026-08-10T04:30:14.450759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.772125Z","title":"CVPR , year=","venue":null,"work_id":"1fbd2696-2dd0-4e74-8dbd-e110a5f93dc7","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.454179Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9b78ddfeedb637a2c337cef18b4bb98bcbb84a8e131217036f49654550280cca","observation_id":"04c5c2e7-9d73-4d01-9880-688927c997e7","resolution":{"observed_at":"2026-08-10T04:30:15.775868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.761831Z","title":"AAAI , year=","venue":null,"work_id":"bb1fc262-cdd3-463a-86fc-a787432cd3cf","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.457768Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:814aad200bc09c42ffee148f7e1609edc43be88cb8c0dac802c8f34caef56117","observation_id":"b7787d07-583c-4a18-81f7-f54d3e940750","resolution":{"observed_at":"2026-08-10T04:30:15.765249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.751041Z","title":"ECCV , year=","venue":null,"work_id":"4f9417bf-ca8f-4f5e-a3ac-520089bbbc49","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.461441Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:bacee9440a58a2350854c4a281ea46e97e4f8a6ee40544cdefdb26f9213faac9","observation_id":"3ec38fa5-dacd-434a-b02d-69faf847e68e","resolution":{"observed_at":"2026-08-10T04:30:15.754472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.739725Z","title":"NeurIPS , year=","venue":null,"work_id":"d31269ea-872b-4998-8e9f-1ccf2f3414c3","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.464845Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:a17be805bd882f6d1a11b97b0a36ad6d89ae91adfdf4de09b3a5b36d9987b119","observation_id":"40a305b0-f104-48b5-866b-d91e4a27bc00","resolution":{"observed_at":"2026-08-10T04:30:15.743459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.727583Z","title":"CVPR , year=","venue":null,"work_id":"9aaebb11-2eee-4e9e-ae73-10b1b0e86a99","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.468161Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:3acff28ff0d59ddb5ab3e031af0341edfbe31862ba4466b38323de51ac8cbc0a","observation_id":"f66abced-ddcb-4954-8520-3e15de978fef","resolution":{"observed_at":"2026-08-10T04:30:15.731968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-10T04:30:14.471570Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.471570Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c7710917457ec076d1b3efe10ec8010535e1dd8979f5ff222902872ecc54b73b","observation_id":"caa523ce-41c7-476e-a371-1ba415be5e77","resolution":{"observed_at":"2026-08-10T04:30:14.471570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21307","last_updated":"2025-03-27T09:31:35Z","snapshot_observed_at":"2026-08-07T16:33:24.689717Z","submitted_at":"2025-03-27T09:31:35Z","title":"InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21307","snapshot_observed_at":"2026-08-10T04:30:14.475211Z","title":"arXiv preprint arXiv:2503.21307 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.475211Z"},"links":{"cited_paper":"/paper/2503.21307","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:468acf2897ce03fb47d643b097ea011618cdb5eb43edfed91f4aa9b057f478fe","observation_id":"3e278458-c443-4484-aac3-85b23c675074","resolution":{"observed_at":"2026-08-10T04:30:14.475211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.478903Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.478903Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:585aebc4f708220a6469bb1111a8349e28d8de663fb0a287f7164a1663a342d3","observation_id":"f3da428c-2a7a-49f5-ad92-2ef1b917e3e8","resolution":{"observed_at":"2026-08-10T04:30:14.478903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T04:30:14.482592Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.482592Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:fc412ffea72faaac0e832beddfe08d2a1d1cca26a2653ca5a34f9bdbd0792538","observation_id":"33aaf4d2-def7-4a77-8995-12df540f570b","resolution":{"observed_at":"2026-08-10T04:30:14.482592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-10T04:30:14.486359Z","title":"arXiv preprint arXiv:2412.19437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.486359Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e653c052fbd0542cb7383b8ae12812b5d83d928d528f1ddd3d94657b1edbf413","observation_id":"019cdcc6-3c79-4eb6-aa13-02a89bf8fe65","resolution":{"observed_at":"2026-08-10T04:30:14.486359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T04:30:14.490105Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.490105Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:57b9f591f5763e3735c9e4cba973ced42e9416a9e41ae85df7417c20a14c28e6","observation_id":"a9fe5aea-29c6-4dcd-8398-07cc5861b1cb","resolution":{"observed_at":"2026-08-10T04:30:14.490105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.708429Z","title":"AAAI , year=","venue":null,"work_id":"85c21d14-1108-46ac-826f-3b2cead8c829","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.493811Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:4315ba80e1e3f2b9b33f8f1bcb90e7762f6ec5595d2eb4c07ea1135c8dadb9b7","observation_id":"4d21e384-dc0c-4128-b777-d704c90f14bb","resolution":{"observed_at":"2026-08-10T04:30:15.712087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.497187Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.497187Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e0f63003eec20516d529a8f0aafd1f4cd4331ac935a5a6f102697a9a814bdb37","observation_id":"044e74ac-68f1-45b6-b553-57d2505b46b7","resolution":{"observed_at":"2026-08-10T04:30:14.497187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.500265Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.500265Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:715460eeb1be32f3cc03aeaebef1678423cc46bf4e55cf22c6ef963a00523ca7","observation_id":"f2c659c3-613d-410a-a1eb-09ec16f00ad9","resolution":{"observed_at":"2026-08-10T04:30:14.500265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-08-10T10:34:53.296935Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-10T04:30:14.503529Z","title":"arXiv preprint arXiv:2307.02628 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.503529Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:d99bcedb61f2bc6636fbed7d3d426e3f147d636526865441755debcdb8022c03","observation_id":"c403b17c-df75-49e6-a8f4-2bb4ad3f6767","resolution":{"observed_at":"2026-08-10T04:30:14.503529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-10T04:30:14.506806Z","title":"arXiv preprint arXiv:2506.04179 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.506806Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9a55e846ac4182d5307f02f398740952b62dd584f11acbc6923162cf39449d3a","observation_id":"8ec82576-f1d4-4563-a1ce-99ee577f7eab","resolution":{"observed_at":"2026-08-10T04:30:14.506806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-10T04:30:14.510251Z","title":"arXiv preprint arXiv:2404.02258 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.510251Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:1b63a57276827e622aac8fff7fcb6e8eb46bae674a46a024d9d71f81b95ac9c0","observation_id":"204158c3-e71a-4351-8031-9963114faf95","resolution":{"observed_at":"2026-08-10T04:30:14.510251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.682909Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"90cc6c80-0d10-4c6e-895c-a7988e883294","year":2025},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.513961Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:ed2d2628d60a52a7ae1b69ab82c74f9747c544b1b7abcef50b780969e793a875","observation_id":"41a5184a-a68f-454e-a9cd-4422249b0d01","resolution":{"observed_at":"2026-08-10T04:30:15.686593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03043","snapshot_observed_at":"2026-08-10T04:30:14.517712Z","title":"arXiv preprint arXiv:2512.03043 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.517712Z"},"links":{"cited_paper":"/paper/2512.03043","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:d291771c1498700375ac85f53c49d9a76c3b7c100d9192093116f65f3a43d059","observation_id":"09aec212-b394-4a0a-ab5a-ec21b1b564b9","resolution":{"observed_at":"2026-08-10T04:30:14.517712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23950","last_updated":"2026-04-27T01:56:59Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T01:56:59Z","title":"LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23950","snapshot_observed_at":"2026-08-10T04:30:14.521293Z","title":"arXiv preprint arXiv:2604.23950 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.521293Z"},"links":{"cited_paper":"/paper/2604.23950","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:d99e433f96d4a366be75625755a194a809d6cf665aeb4f198344921ca7e7675a","observation_id":"b8dbd646-f81e-45ae-9aed-dae7da1668b8","resolution":{"observed_at":"2026-08-10T04:30:14.521293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.525086Z","title":"arXiv preprint arXiv:2601.22674 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.525086Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:808486f7f0d20022ab257b21e6d2da3caca23d534bb41823d3fa5dda2a89ba92","observation_id":"f5d1790a-cddf-444e-b41d-4f6533f24bba","resolution":{"observed_at":"2026-08-10T04:30:14.525086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.670761Z","title":"AAAI , pages=","venue":null,"work_id":"63b6d757-d720-4bf4-8f8e-b7d3351df09f","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.528582Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:658694edc591e99ea3fb751e064d45641e3faa147c9461f15b32436d63efdd25","observation_id":"e7b0d891-b32c-481b-b396-e3e10cc6872e","resolution":{"observed_at":"2026-08-10T04:30:15.675107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.658756Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , year=","venue":null,"work_id":"45a56fa5-b7f2-451e-8b9c-6a6afaffc0a7","year":2025},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.531924Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:17fd3108a077ef46d5560559cfe1bd1b6def20a94304e335f2d1e6736d98d2a5","observation_id":"13f1b919-3589-4789-9d9a-62e60ffdf5f7","resolution":{"observed_at":"2026-08-10T04:30:15.662753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.535753Z","title":"arXiv preprint arXiv:2602.23699 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.535753Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:eee4443df5bf2ed1ab72a85abce0b36438b79b844fa360b044f522ecad85bc49","observation_id":"f250d59f-7c12-45d5-ac2b-c74a27ad96b2","resolution":{"observed_at":"2026-08-10T04:30:14.535753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T12:09:48.480614Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":85,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 0 inbound Pith citation observations for arXiv:2608.06411."}