{"as_of":"2026-08-21T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b6a87dd411eff098bb3058decfa6ec0c713c9fb12fed837d57c20db43d64cf6","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:45:59.108312Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:51:16.303359Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:04:01.860140Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2603.05950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.05950","snapshot_observed_at":"2026-07-31T02:06:21.532085Z","title":"Energy-driven adaptive visual token pruning for efficient vision-language models","venue":null,"work_id":"ec2e2072-2c4e-409d-b6c2-bc065700da9b","year":2026},"citing_paper":{"arxiv_id":"2604.24391","last_updated":"2026-04-27T12:20:53Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:20:53Z","title":"FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T03:10:29.477937Z"},"links":{"cited_paper":"/paper/2603.05950","citing_paper":"/paper/2604.24391"},"observation_digest":"sha256:4f1330e79f59cc6a5ce84fcb9d369705ad0bd31091398e07e199ed5cdb8207eb","observation_id":"1e526df3-20e0-4f1d-83a8-fabdb1c779ec","resolution":{"observed_at":"2026-07-31T02:06:21.532085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2603.05950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.05950","snapshot_observed_at":"2026-07-31T02:06:21.532085Z","title":"Energy-driven adaptive visual token pruning for efficient vision-language models","venue":null,"work_id":"ec2e2072-2c4e-409d-b6c2-bc065700da9b","year":2026},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":260,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2603.05950","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:6140dc5342d9d838c1e64e015e1c3487b14cd684405f60066b7c20fec7836e3b","observation_id":"c8d63ad2-fb6b-4485-9345-34bb3353ab34","resolution":{"observed_at":"2026-07-31T02:06:21.532085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2603.05950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.05950","snapshot_observed_at":"2026-07-31T02:06:21.532085Z","title":"Energy-driven adaptive visual token pruning for efficient vision-language models","venue":null,"work_id":"ec2e2072-2c4e-409d-b6c2-bc065700da9b","year":2026},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2603.05950","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:c6c845ac90ec36036d932d892a76c58cb079c503d68aa3a32cc30f454341bdf1","observation_id":"78282162-7d68-4e52-8bd3-e48a6164f750","resolution":{"observed_at":"2026-07-31T02:06:21.532085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05950","snapshot_observed_at":"2026-08-10T04:51:16.303359Z","title":"Energy-driven adaptive visual token pruning for efficient vision-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07427","last_updated":"2026-08-07T17:14:45Z","snapshot_observed_at":"2026-08-20T11:03:30.809456Z","submitted_at":"2026-08-07T17:14:45Z","title":"A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T04:51:16.303359Z"},"links":{"cited_paper":"/paper/2603.05950","citing_paper":"/paper/2608.07427"},"observation_digest":"sha256:a7a892daa40944c22c6b605c4f1e0ec884c9f63f23c8c1f24a5661504d35119c","observation_id":"92c823a5-1470-42e2-8e75-c50bdc24a828","resolution":{"observed_at":"2026-08-10T04:51:16.303359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.05950/citation-record","integrity":"/paper/2603.05950/integrity","json":"/paper/2603.05950/citation-record.json","paper":"/paper/2603.05950"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T18:45:54.283820Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:54.283820Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:33dab0f3bf076eab4740918cb732ea8685e3f4a25882f8ff1e2343483cab7d1c","observation_id":"cf9e99a0-5d13-45f3-ae7d-e06540dfed11","resolution":{"observed_at":"2026-08-02T18:45:54.283820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:54.386495Z","title":"Advances in neural information processing systems35, 23716– 23736 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:54.386495Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:ddfc5b81cc220dbd4a8d738b6059cc9df96b51d395852c63e494e2faa3b26589","observation_id":"89064253-6f59-4169-b841-7e12ac980067","resolution":{"observed_at":"2026-08-02T18:45:54.386495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T18:45:54.459297Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:54.459297Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:14e8afa15b87e2d1b9fb69d6173569cbea6c04ae6ebac0d230e8e126ab1580c6","observation_id":"737e7fd8-18a0-48b8-84d0-7c6ee8a36fcb","resolution":{"observed_at":"2026-08-02T18:45:54.459297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:54.570372Z","title":"In: The Eleventh International Conference on Learning Representations (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:54.570372Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:9d6f77ba16c0d1e3933cd66e74fca46b7c7bf76bb02b7fd25d9c9348f2232584","observation_id":"db7334e7-2a43-4b80-aabc-43555b41d59c","resolution":{"observed_at":"2026-08-02T18:45:54.570372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:54.715940Z","title":"In: The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:54.715940Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:4ede968aedc907106f180528dd149fc3d1367c1c7279b135e3210c9eefa306ed","observation_id":"caee3828-128e-4f67-bd2b-caaf39f1e181","resolution":{"observed_at":"2026-08-02T18:45:54.715940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:54.874950Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pat- tern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:54.874950Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:ed546fd904e58e10bcf2a268dd5734fa98c67ada330d5eb8fe3d3679f0bd704b","observation_id":"6c32310d-0dce-4d38-818e-8eea0d4b6802","resolution":{"observed_at":"2026-08-02T18:45:54.874950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:55.023490Z","title":"Advances in neural information pro- cessing systems37, 73986–74007 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:55.023490Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:b83d6d3eabe50d45ae3e62954d4a16e78547472f68d928ee64ed595d72eb6a5c","observation_id":"031a7641-ca60-496b-96d3-f95ba606ce62","resolution":{"observed_at":"2026-08-02T18:45:55.023490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:55.183337Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:55.183337Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:c68aece55709e0c34f23542aefec4f656d2898799625404fa22f82df662d56b1","observation_id":"2ae9ef64-9935-49b0-bd5b-0d5a512b1aeb","resolution":{"observed_at":"2026-08-02T18:45:55.183337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T18:45:55.312267Z","title":"arXiv preprint arXiv:2507.06261 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:55.312267Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:943dcd37f3f8528b0346476f55a9d5fd660d503476bf258540370505399c8219","observation_id":"6c3fd772-4b88-4d2c-8e10-a3bae9164cfe","resolution":{"observed_at":"2026-08-02T18:45:55.312267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:55.421856Z","title":"Advances in neural information processing systems36, 49250–49267 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:55.421856Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:735eb9c3499cf05370eed7fb80573d26fd17e1b5303b61580db30e31e5325c82","observation_id":"2a2f8f2f-9d2f-4e8e-8ec9-c671752dd83f","resolution":{"observed_at":"2026-08-02T18:45:55.421856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:55.539057Z","title":"In: Proceedings of the 60th Annual Meeting ofthe Associationfor Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:55.539057Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:2f23c5262b15ba248522bcb13ffacb35438fdfeecd59d89cd083ffe2db05be38","observation_id":"136ca392-b46a-455f-a8e1-1849a7b89ab5","resolution":{"observed_at":"2026-08-02T18:45:55.539057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:55.692293Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:55.692293Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:f35d08885ed02e5cd13db1ce6a3484fd1c650d3853e6c088d3d2545d89d57648","observation_id":"06a622f6-4bee-4ef6-b20e-78dfdb4966d4","resolution":{"observed_at":"2026-08-02T18:45:55.692293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:55.887911Z","title":"SIAM review53(2), 217–288 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:55.887911Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:c827eee9b4970bf7e53e8f6c58a13a183704c4b5d693fcf4af4ab3e63add8b1c","observation_id":"3b13d415-2767-4996-a661-293393223481","resolution":{"observed_at":"2026-08-02T18:45:55.887911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.000089Z","title":"He et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.000089Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:cd175ed6b79c2b2a34a4b8295fb232897c24e9b69e3691e72ceec993bfd4911c","observation_id":"e51d978a-1939-449c-aeb7-8a6aa642e034","resolution":{"observed_at":"2026-08-02T18:45:56.000089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.071545Z","title":"In: Proceedings of the IEEE/CVF confer- ence on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.071545Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:8816d3b712c37c9516c71cd073aa206e156395867390804354282b34a831fac1","observation_id":"336e82c1-1a67-4db8-8038-473a1488407b","resolution":{"observed_at":"2026-08-02T18:45:56.071545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.143951Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.143951Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:3497829f35c55cdf0facbaeaffc2183363f83a9e70a4442d38fd7776b879d733","observation_id":"8718a084-e66a-4fae-9638-2b895e403e2d","resolution":{"observed_at":"2026-08-02T18:45:56.143951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.195311Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.195311Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:5043e868119862351f2c2ee81e1b844e1fbb39e8a3f3fa0a215cda67308fa5af","observation_id":"8b64c871-dbff-4c4b-baf2-5860863ef341","resolution":{"observed_at":"2026-08-02T18:45:56.195311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.269911Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.269911Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:63174dafba337cd2785ea0b1e22b0c6613ed27c3489bbf2cd5829f452b01a167","observation_id":"99c97fa7-1ccb-4c44-9798-330010bd7f50","resolution":{"observed_at":"2026-08-02T18:45:56.269911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.337770Z","title":"In: The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.337770Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:a3ca906b2043d51197befcf2ca320a3283362dc546c9c21f59070abf8c09f4ec","observation_id":"ec0d5457-7463-4ed4-b9ff-039f5e55a94d","resolution":{"observed_at":"2026-08-02T18:45:56.337770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.402027Z","title":"In: Proceedings of the 2023 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.402027Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:c73e95009682b2bccd2d4ef6baa9286094808e40b46e003c1ee7ab1ccbd5618d","observation_id":"45d059c6-e33e-440d-9bb5-37218d97ca41","resolution":{"observed_at":"2026-08-02T18:45:56.402027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-20T17:46:54.459933Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-02T18:45:56.504819Z","title":"arXiv preprint arXiv:2501.021891, 1 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.504819Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:5e715d1c36cbdfb87fa465209c9b3c6811b6d58a597d4bb6b343d8cfbebb4145","observation_id":"99926049-bdbb-4d59-aa20-e4231d3562af","resolution":{"observed_at":"2026-08-02T18:45:56.504819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.600869Z","title":"In: Proceedings of the AAAI Confer- ence on Artificial Intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.600869Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:5925b2023c16b2c4560d0e89a56fbc80bf1f68cb836d461ca4125895c16cea67","observation_id":"126a4ea0-09a0-4e8d-a300-953bbde51131","resolution":{"observed_at":"2026-08-02T18:45:56.600869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.707978Z","title":"In: The Thirteenth International Con- ference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.707978Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:3add5edb62121ae40bf21384a7d582bb00ef60e8787011c7ec909e2a81378eee","observation_id":"96448390-317f-43c7-a479-c401a99029a2","resolution":{"observed_at":"2026-08-02T18:45:56.707978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.832716Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.832716Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:79e3f8dc51ea9448dcdedaa441ba497f2be621ab439fa5eaac5985b62aec7393","observation_id":"33b45742-4ede-4592-93d4-602479cd3747","resolution":{"observed_at":"2026-08-02T18:45:56.832716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:56.994887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:56.994887Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:71436363983b803ad0d4346ac98b1b50d418aa913912c98382de6cb593382f7c","observation_id":"764ee4e0-db35-4c93-858d-694c4755edbb","resolution":{"observed_at":"2026-08-02T18:45:56.994887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.150980Z","title":"In: Thirty-seventh Conference on Neural Information Processing Systems (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.150980Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:b525ebfa747e9bf323c7b1c847deaee8c9d45500b948578e51591b610b46db42","observation_id":"caeae5fe-969f-4e33-9f97-0f5fed85cf10","resolution":{"observed_at":"2026-08-02T18:45:57.150980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.301911Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.301911Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:04bf2c1ab418bc13317c5efe1ad5087a7696dc7ad5ed2227e61f8324c79872cb","observation_id":"f5393465-b11c-4fd5-a04e-17a705b65dd6","resolution":{"observed_at":"2026-08-02T18:45:57.301911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.405819Z","title":"Advances in neural information processing systems35, 2507– 2521 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.405819Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:a60f53eb2f3464c2645654080452fc5ab3c2da5f52b85833f142e8b08992e96f","observation_id":"42c6d4bb-334f-4f3d-ac0a-addae59593f2","resolution":{"observed_at":"2026-08-02T18:45:57.405819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.481803Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Sys- tems (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.481803Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:eb7a8ddd7874e3a6d79d5400408b4d7ba46feac89981d1ea939fb1508f5d58d6","observation_id":"5f5d785c-d064-4d99-b75b-97dfe7408c38","resolution":{"observed_at":"2026-08-02T18:45:57.481803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.549462Z","title":"Foundations and Trends®in Machine Learning3(2), 123–224 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.549462Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:4043045a3637705b10ba6d6baf4076832411125e09572535e103dfc7e5f5affb","observation_id":"9ae72c76-b8b4-4fad-92c2-3736c48283d6","resolution":{"observed_at":"2026-08-02T18:45:57.549462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.664552Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.664552Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:fb3f3f01b9cbe4025118686e71f5d5e61abd2c13fbfffef61cc9c9647090f7ee","observation_id":"bcbba7f6-d38c-4206-9506-7878dcbec738","resolution":{"observed_at":"2026-08-02T18:45:57.664552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.732980Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.732980Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:f11b34f301fa41f04de3910af2d64310b712f01127d96f2e88c98d90fb030378","observation_id":"34c46798-9cb7-4595-8fcf-cb9212b1eb03","resolution":{"observed_at":"2026-08-02T18:45:57.732980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.830085Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.830085Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:fd9a60c8190872446bcc714825ccb03a82426b8dd21497dd09b6a3cf58ebeb0b","observation_id":"43b96c3c-f85b-4550-a562-b5b5012ffd90","resolution":{"observed_at":"2026-08-02T18:45:57.830085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T18:45:57.879859Z","title":"arXiv preprint arXiv:2403.05530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.879859Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:db43051c467f0cbf241f200d053fbd5546d2e0d8767127c5e6fd4c9d821bf2f5","observation_id":"8f1d2b5b-ee98-4582-9f8a-f67c09ba1041","resolution":{"observed_at":"2026-08-02T18:45:57.879859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:57.940900Z","title":"Advances in neural information pro- cessing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.940900Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:4d962ea89941c81d01718047adf52c5981b918afe97bf55e1804aa507bb3daf1","observation_id":"b8652bfd-e4e4-41c0-bab1-c46eac360714","resolution":{"observed_at":"2026-08-02T18:45:57.940900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T18:45:57.994599Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:57.994599Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:de87141983c2b05993ebaf4e79014ee7eab3678d2c2cd7a8fa840bab689da868","observation_id":"c0c7c5ee-86de-481d-b890-4434ea4d2150","resolution":{"observed_at":"2026-08-02T18:45:57.994599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.075989Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.075989Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:237e6a5af9aea90a9da87b2678547103c0c2e70e43a1334a33285069e527f761","observation_id":"3c3b2a4e-1e98-4ac7-b2ba-d9e8d0b2e34e","resolution":{"observed_at":"2026-08-02T18:45:58.075989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.150546Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.150546Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:74fea8169ed3caa5c95f245fc0b06b25bd26b9cf04ad13321b71994516468d7b","observation_id":"a567a97f-eb9a-4251-a948-070d717a5329","resolution":{"observed_at":"2026-08-02T18:45:58.150546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.195952Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.195952Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:7be9c63b7a6332fbb36d39e1fec50da4ad5db2cfd75280efadeb50fcaf2b7a6b","observation_id":"2916ddb6-7798-48b6-8fc4-42f167dd2d2e","resolution":{"observed_at":"2026-08-02T18:45:58.195952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.278397Z","title":"In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.278397Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:713177bffcefb91593822e74f7d5659cc4d252308e828ad4ae0ed34c86ac24c4","observation_id":"00ac6b63-cc89-47ed-9d63-30208ab8cc0c","resolution":{"observed_at":"2026-08-02T18:45:58.278397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.340559Z","title":"Authorea Preprints (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.340559Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:2b7a79c2b58618ddac61d8ba8308da3a120020a802fe85d5942bb4130537690e","observation_id":"785be0e7-3d67-44a6-bc95-ad59c28eb3d8","resolution":{"observed_at":"2026-08-02T18:45:58.340559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.421780Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.421780Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:6639757d2fdbd145c7c92e3c3ac53142888ac322ea6eaf8188c381aed5a6a68f","observation_id":"ce9ca7c6-d7d2-47a2-9f35-d5c914f34404","resolution":{"observed_at":"2026-08-02T18:45:58.421780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.504273Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.504273Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:f0bdc2f30c86702506165c73716d12c16438612e1dd1b48e676e696e7a7ccc36","observation_id":"8ce2e5be-f5fa-4dcc-8636-ccbfbf26a4be","resolution":{"observed_at":"2026-08-02T18:45:58.504273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-02T18:45:58.561475Z","title":"arXiv preprint arXiv:2308.02490 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.561475Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:e3c2db9d905a535caf7148b9062f22bb98fc55b022118fda30e16cd14770d7a1","observation_id":"5c81e0f9-57de-4dcb-a7de-b32758eb4e2b","resolution":{"observed_at":"2026-08-02T18:45:58.561475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.625043Z","title":"IEEE transactions on pattern analysis and machine intelligence46(8), 5625–5644 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.625043Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:691eab16a81229475d174a648d51cbaad3233bcea4a44d92f7c42681e4f15df7","observation_id":"a9e0d786-198a-4bbc-abe8-2d6aa773c3d4","resolution":{"observed_at":"2026-08-02T18:45:58.625043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-08-17T05:14:27.567959Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-02T18:45:58.668589Z","title":"arXiv preprint arXiv:2309.15112 (2023) 18 J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.668589Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:ddecadc77c33004a1cd804837f0ae0d44772267a77582bdb39b5dca5f15661f9","observation_id":"a0e51aab-85da-467e-848f-b9d5f189b9ce","resolution":{"observed_at":"2026-08-02T18:45:58.668589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.781905Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.781905Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:95c45252d1f276564114a8215ab703296a1c5428e75008003907a32acddcdd61","observation_id":"54f9a890-76cb-468c-beb8-00dc0b132517","resolution":{"observed_at":"2026-08-02T18:45:58.781905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:58.887860Z","title":"In: Forty-second International Conference on Machine Learning (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.887860Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:cc26e88e8b4892f539997f38dd9ab1f37c7daa3c7f8290de1180b7b4409f05c1","observation_id":"6c8ab119-90a1-4d02-a44d-477cd2a0bf88","resolution":{"observed_at":"2026-08-02T18:45:58.887860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:59.004144Z","title":"In: The Twelfth International Conference on Learning Representations (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:59.004144Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:e8febeca47094689a2ee9b9e507f6df06f540fe2cceb13f8547fc6616d83df5a","observation_id":"7a92f221-f0a5-430b-85ea-16e1bdb66649","resolution":{"observed_at":"2026-08-02T18:45:59.004144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:59.108312Z","title":"highlighted tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:59.108312Z"},"links":{"citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:f083854d9893a8950e19e71961b64cebd1350cb69af9bd19e1e07bf1f7780103","observation_id":"479c6eea-1448-4b62-aa80-487d2ca1d49c","resolution":{"observed_at":"2026-08-02T18:45:59.108312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T20:24:40.199057Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 4 inbound Pith citation observations for arXiv:2603.05950."}