{"as_of":"2026-08-10T17:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e0d587668687ed69a70e027fd23d384071b0dafe9afd2be59802c979fdf4cad","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:42:29.264825Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:03:26.782904Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:59:57.422464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2604.05887","last_updated":"2026-04-07T13:51:07Z","snapshot_observed_at":"2026-07-06T22:54:30.567988Z","submitted_at":"2026-04-07T13:51:07Z","title":"HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:58:45.374139Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2604.05887"},"observation_digest":"sha256:b6ea1f3f3b624cb240ee4711179d18d6994a84e7db35d0b6a77e550ec5db5119","observation_id":"a3a4f5ed-3447-4948-8f42-5d316adb27df","resolution":{"observed_at":"2026-05-10T22:20:48.354550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2605.28115","last_updated":"2026-05-27T08:09:44Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:09:44Z","title":"CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:12:51.867760Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2605.28115"},"observation_digest":"sha256:7642cdd0f1f86f3a768491f6c466ad6f9703dd9e2c2329df5d7a4d394bdf6246","observation_id":"cfbce84e-0766-4d32-b12b-649646c1da17","resolution":{"observed_at":"2026-06-29T12:13:26.454047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2606.24156","last_updated":"2026-06-23T05:24:50Z","snapshot_observed_at":"2026-08-08T04:43:36.112271Z","submitted_at":"2026-06-23T05:24:50Z","title":"Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:00.373247Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2606.24156"},"observation_digest":"sha256:741a8aa5644efd5b774799448f6f587f5fb2a2b3ebd2acd60283b6303f36be69","observation_id":"f36012ed-4480-4707-9ac7-e2c97e48ee7b","resolution":{"observed_at":"2026-07-04T15:59:56.765099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2606.24165","last_updated":"2026-06-23T05:39:52Z","snapshot_observed_at":"2026-08-09T10:49:58.540867Z","submitted_at":"2026-06-23T05:39:52Z","title":"Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T01:04:20.802531Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2606.24165"},"observation_digest":"sha256:8c6697ece49ffd4f171eada72561b50fd0ec7ab3691c679a47a50b831f4872c1","observation_id":"be980c68-f51c-42f2-9eb3-a29cbae6d681","resolution":{"observed_at":"2026-07-04T15:59:57.423842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-08-02T05:03:26.782904Z","title":"Lightvlm: Acceleraing large multimodal models with pyramid token merging and kv cache compression,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-08T12:47:41.651047Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.782904Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:a6c592168b6a3e52666cf4d7376a61acb5a4cc3674b564618914f612e69eb0da","observation_id":"d13bbfb4-1f49-43db-b16c-80d33edd3730","resolution":{"observed_at":"2026-08-02T05:03:26.782904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00419/citation-record","integrity":"/paper/2509.00419/integrity","json":"/paper/2509.00419/citation-record.json","paper":"/paper/2509.00419"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:22.672491Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.672491Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:38e97594f8c50076ea9ffe6e8a53ed94babeff8c07c5a0923da4cccf94ddc225","observation_id":"e39a8bf1-6a96-4633-a840-16d2d58e8397","resolution":{"observed_at":"2026-08-05T13:42:22.672491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:22.774072Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.774072Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ee5670537b0bb7f5a0aa61f3aa871df31d8168928384deeecc6e25adc61b9f13","observation_id":"e9af7304-6f1e-4b75-93f5-cf7be541e311","resolution":{"observed_at":"2026-08-05T13:42:22.774072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:38.266627Z","title":null,"venue":null,"work_id":"1078905f-d4d3-44fb-910e-9d8b63a31689","year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.832068Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:66364909ad473690b316c10eac3edd5b2fcf5a908a81e0dda0708a198b1176ad","observation_id":"3f5f2323-fbf7-48d4-b866-c3214d6797bf","resolution":{"observed_at":"2026-08-05T13:42:38.342321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10945","last_updated":"2024-12-25T01:27:01Z","snapshot_observed_at":"2026-08-10T17:11:09.255565Z","submitted_at":"2024-08-20T15:34:27Z","title":"HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10945","snapshot_observed_at":"2026-08-05T13:42:22.903167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.903167Z"},"links":{"cited_paper":"/paper/2408.10945","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c1a0f0e8f5ae85ac85d7203d2fd10acea80527e0ae261dfd63e191ecc45f7e68","observation_id":"d7f06c1f-40ff-48c0-80e1-ca68a43e3c98","resolution":{"observed_at":"2026-08-05T13:42:22.903167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T13:42:22.989120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.989120Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:36045c847671a7c100752b170a21b715ac0ee850da97755dae4d8a6827badb59","observation_id":"603fcc49-fa2b-4b00-8795-4c2462b8697c","resolution":{"observed_at":"2026-08-05T13:42:22.989120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:23.065410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.065410Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:6139458a96ed20cbc26915c723e4697ba8e6ce100bdf958b557f00bd5c4a628b","observation_id":"347f759e-8492-48c5-84ef-6dfbb74b682a","resolution":{"observed_at":"2026-08-05T13:42:23.065410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T13:42:23.148844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.148844Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:3865fc6b0963589ba41be2ed2c9b6aa0f7a3d4729ce4f075b1dbf58a98f95d9c","observation_id":"19f6daa0-b112-4d0b-8739-d3cb0e016320","resolution":{"observed_at":"2026-08-05T13:42:23.148844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:38.060679Z","title":null,"venue":null,"work_id":"1096ffeb-bdff-4875-ae8a-39b81788f095","year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.218377Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:8dc6cc67590a765b97a1e1468fc640a0aedd858a0646ca134b7005d9113fbde2","observation_id":"df1e7d22-0ce9-428d-aadb-65a68c83b5fa","resolution":{"observed_at":"2026-08-05T13:42:38.139124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T13:42:23.334060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.334060Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:5fe72a1baa6ffd8116e2d153b7a82c34bba41d0a101be5fdfaf70cf7cde6b8ba","observation_id":"7dd90ed1-4f5f-402c-b270-bec831610849","resolution":{"observed_at":"2026-08-05T13:42:23.334060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T13:42:23.415022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.415022Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:523829e4b04d93b45e045776c6f55dccb3270e64a4be931da700ec8da75f5cd6","observation_id":"b71f6f9e-8bbd-488c-af92-ebd5aa486989","resolution":{"observed_at":"2026-08-05T13:42:23.415022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T13:42:23.508694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.508694Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:b8f29cb6ff5d3232581115ec80a534a514c217d8d11c110a6e33200fa490a760","observation_id":"560f4c9c-079f-44b7-8539-577a27236f78","resolution":{"observed_at":"2026-08-05T13:42:23.508694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i16.33842","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"ecdb49e3-7aa9-4539-b32c-01b8eff270d5","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.585796Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c56dfde2ed4d0b936b1ecd2525ef9bddf0c89513d89429558a7b4ef00b4b671e","observation_id":"f23f3775-03fd-4e32-a21e-5b146cf594ea","resolution":{"observed_at":"2026-08-05T13:42:29.439727Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.876007Z","title":null,"venue":null,"work_id":"4790d6bc-fafd-4f7b-88b7-88c5a215789b","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.648614Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:10b3e90604fe683d2cfc574e116340a72cd25304e6adc4b60cf30a430bac92b1","observation_id":"1147cb59-830a-408f-99b9-19c28faace18","resolution":{"observed_at":"2026-08-05T13:42:37.952475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10651","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:30.886779Z","title":null,"venue":null,"work_id":"883350e2-4e91-411d-806d-4f8783b2b430","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.704750Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ef2fa2923d31ea56845e8e569386ea06bf570e0f008ab8049c4e8381bad86b54","observation_id":"71527a54-85a4-408a-a8cc-59a865b404be","resolution":{"observed_at":"2026-08-05T13:42:31.030779Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.641353Z","title":null,"venue":null,"work_id":"19e3c9da-9852-4010-bcd1-f3c675b7ee42","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.780641Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ead9ea7904111d12687ef6292494174ef5074d7b53c7a09e24f51341d06fb366","observation_id":"a885e856-5489-4b10-a5b8-8f1246dbcfe6","resolution":{"observed_at":"2026-08-05T13:42:37.764141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.453382Z","title":null,"venue":null,"work_id":"5870a717-815d-4a12-88be-9c21abf480cb","year":2020},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.844900Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:7d5adf58998badd5ff4b5a30612fd28fc2e7475665ae368c0af0ef712e2402c0","observation_id":"ae53f67d-1f4c-43a2-b450-9aa43406ddc4","resolution":{"observed_at":"2026-08-05T13:42:37.533292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.220506Z","title":null,"venue":null,"work_id":"8ea301ee-f2d3-42e2-8dc1-9a54f0e4aae9","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.933695Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c6d142c529f3b970cc988f2553743c330418d64d0df80c08733589397dfde1b6","observation_id":"c74e6b7b-d87b-4c18-a689-7a8d5c6b64e9","resolution":{"observed_at":"2026-08-05T13:42:37.330147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.982938Z","title":null,"venue":null,"work_id":"a4d37b58-82e5-4ef7-b630-34a9035e68f9","year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.938646Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:cd131e60d7578cae2af0800daba3713b03dd52fbad19149b55666729ef49f5d1","observation_id":"2dc21c2c-f757-4c8f-8ff8-2dacefe3fbdc","resolution":{"observed_at":"2026-08-05T13:42:37.092695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.776867Z","title":null,"venue":null,"work_id":"d46aa945-c7b1-4675-995b-a1d2fec25187","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.944156Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:5d2e42bd18ef8091d70b9ced880253501f53a8e1c84e5cdb72b68432cbc035b3","observation_id":"15e204f8-d967-4db2-8f4e-5215cf798120","resolution":{"observed_at":"2026-08-05T13:42:36.854096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.539495Z","title":null,"venue":null,"work_id":"ec92238d-e7ea-4ae4-9c90-ce34a8d7346e","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.951604Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c759f95437fcede1e0c83c041f54860a3ce036b19b6e2a93e8126b1aff39b753","observation_id":"88adabbc-f3bd-4964-881c-21c49781875d","resolution":{"observed_at":"2026-08-05T13:42:36.663296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T13:42:24.024369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.024369Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:64889799f96f187269e8b9bb99aa10ba3d9e08d969f25c7e0bb29ec0441b1790","observation_id":"7942e703-e04c-4a86-9248-d90e23cb6765","resolution":{"observed_at":"2026-08-05T13:42:24.024369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:24.135702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.135702Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:2f96f7a68c48f5108393a175405f43481b939120f744756046caf07ee2a2c101","observation_id":"3a371c47-94e7-4010-9ec6-7bcc63c35797","resolution":{"observed_at":"2026-08-05T13:42:24.135702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07003","last_updated":"2021-06-11T20:00:20Z","snapshot_observed_at":"2026-08-09T20:14:43.195886Z","submitted_at":"2020-10-14T12:28:08Z","title":"Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07003","snapshot_observed_at":"2026-08-05T13:42:24.274676Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.274676Z"},"links":{"cited_paper":"/paper/2010.07003","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d2c847c16dcc2dee911c165594ab83d3aa0c687b4629051214a5bc735d88690e","observation_id":"4d9b0595-6538-432c-8b88-2af5e8c6db83","resolution":{"observed_at":"2026-08-05T13:42:24.274676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.383498Z","title":null,"venue":null,"work_id":"76123102-5969-44fc-bac3-7de0c3549cd9","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.417422Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:edf04db1234bbf03bc836e66379f6163003887c0c505e58070ffdcf9d42c7707","observation_id":"9184c06d-1e16-43a5-a5a6-8298c04848e3","resolution":{"observed_at":"2026-08-05T13:42:36.459732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06540","last_updated":"2021-12-13T10:24:54Z","snapshot_observed_at":"2026-07-06T12:18:03.877754Z","submitted_at":"2021-12-13T10:24:54Z","title":"A Study on Token Pruning for ColBERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06540","snapshot_observed_at":"2026-08-05T13:42:24.576796Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.576796Z"},"links":{"cited_paper":"/paper/2112.06540","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:5ca8d0515f5cc5bab7ec7b092afc8223b7f214b623d477945a9be7ddcbce200e","observation_id":"d544c8a8-2608-4435-bd7b-f86a3f2ebff6","resolution":{"observed_at":"2026-08-05T13:42:24.576796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T13:42:24.706806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.706806Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:797e53a13a57aac90d1e5a98a310fd8bde372b0ed9ab3ccf1f8763a01891cfed","observation_id":"80d32214-cd9b-4680-a3e2-3236d9848557","resolution":{"observed_at":"2026-08-05T13:42:24.706806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.162917Z","title":null,"venue":null,"work_id":"5fe17606-19fe-49ad-8ac4-b7ea522f87ff","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.901234Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:3d8c9dc6382bc449ca41df2ef97a971e67d6d8be0df1b5165952702251e544c2","observation_id":"1fcfaf2a-5b8b-41b2-990d-0e07150b2d22","resolution":{"observed_at":"2026-08-05T13:42:36.283379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.900057Z","title":null,"venue":null,"work_id":"7ccd5491-1ed8-4d4d-8ef8-69a40967bfa8","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.089559Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:64a5f8943aec59aae634e836c827d1f484f47b5953de8086dcdd2031736734cc","observation_id":"a4a0ee39-230b-4234-bb61-943f16198377","resolution":{"observed_at":"2026-08-05T13:42:35.997122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T13:42:25.233873Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.233873Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:fbc450ab523f1745b4cee59baf36dece1266f3e3f2f77d512bcd66661380ee77","observation_id":"64bdbd4b-cafd-471f-b876-bb7f4949788d","resolution":{"observed_at":"2026-08-05T13:42:25.233873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.710902Z","title":null,"venue":null,"work_id":"d0cf35c7-b9a1-4e44-8f8e-e42180bebbd3","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.414858Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:3bdd409e600c1a6807964b3e12e129e2dfaabf45b83e7e022763ca681a1a6dc1","observation_id":"87b720a0-3bce-4fe3-9172-8b2ce2411744","resolution":{"observed_at":"2026-08-05T13:42:35.792606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.524266Z","title":null,"venue":null,"work_id":"85f46d5f-cd53-418e-a348-ea2174a7ea12","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.609037Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:7a5937b778c57438cbe2091ff5f69504a6f73fbb02e59a6ba6f0007d66bf587c","observation_id":"6c4ce98d-5f94-448c-8c52-98e5e06645e4","resolution":{"observed_at":"2026-08-05T13:42:35.620346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:25.812634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.812634Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:2e7d45573e8fd3628bfe057ede996564ad23122122be26f29cb1213e3aa794d6","observation_id":"8f897563-0faf-4608-9fef-cee0c1953d83","resolution":{"observed_at":"2026-08-05T13:42:25.812634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:25.955338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.955338Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:f2c639cd9ef4bf507da6cf8f614d9026834d446859b0e09f2dd30746b26a6a81","observation_id":"e3cfce5f-6fc0-463c-b5ae-ba57ba05aea9","resolution":{"observed_at":"2026-08-05T13:42:25.955338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.261545Z","title":null,"venue":null,"work_id":"7f8cb295-0102-40a6-9b6d-4d3150b533d3","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.130156Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:940034f8b107858e4a4d513b464968edf34341016c823c387bcc70956d6ee4c7","observation_id":"df2cab8c-e828-45da-a04b-041ab567f309","resolution":{"observed_at":"2026-08-05T13:42:35.338419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:26.269777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.269777Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:9353f28310eb9676fa8bf4efcea1461a16a22568db3e8d8053abd96aea1524e0","observation_id":"b3f3b9b4-3496-4f5f-88e8-c0ad221b67bb","resolution":{"observed_at":"2026-08-05T13:42:26.269777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T13:42:26.378907Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.378907Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:45fa09a53121712ab03ff5e5d91f8c82e507aaa4ff8d7e615874ac1c53a05201","observation_id":"8602b363-94c4-44e2-92b9-90a272b24cf9","resolution":{"observed_at":"2026-08-05T13:42:26.378907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.069520Z","title":null,"venue":null,"work_id":"acb33344-a2e8-4deb-b84f-845567a8cefb","year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.485956Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:b00d1d19e49dc2d7670c7128d12bfe35378c1e502eb9e152c1c74217d01ee68a","observation_id":"8fff648c-754a-4a65-abf4-58b9a9a03746","resolution":{"observed_at":"2026-08-05T13:42:35.148319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.772472Z","title":null,"venue":null,"work_id":"cc913ad7-9b0b-48ae-8a7d-8a5c72779132","year":2017},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.592480Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:bb8b6de3773b9ac1e3938888814bf44eb21f407cecd1e0775edf640d0a7454af","observation_id":"7c1019a9-df2d-4491-9132-b0c54f8e5909","resolution":{"observed_at":"2026-08-05T13:42:34.933892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.551439Z","title":null,"venue":null,"work_id":"9f0c6418-7282-49d4-ab14-a3bc00f97e50","year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.700562Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:670a7476e47d29bef9fa3bbc17f69c82417baf36893436ebf09c6d0a0c1e380e","observation_id":"54933ae2-6ad6-44e0-ac61-f8078488fb40","resolution":{"observed_at":"2026-08-05T13:42:34.637417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.298599Z","title":null,"venue":null,"work_id":"39d342bb-9fa8-4284-9587-921579e4ac49","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.834616Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:139263495973daaf6090c8a15ab7854bf0e8c66f964a139c6b030de0c2806994","observation_id":"572a5fd9-9bb5-413f-b21d-fc320bcca9a9","resolution":{"observed_at":"2026-08-05T13:42:34.408199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.072200Z","title":null,"venue":null,"work_id":"87ff280f-6b33-4711-abe4-103584cedccf","year":2017},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.935776Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d5cf02406bddb2470a8fb87e91e8cf5b6a5b85bf6169e6852e3dfa475ab66ad3","observation_id":"268c6568-f2c4-4d78-b141-00cc5df95e19","resolution":{"observed_at":"2026-08-05T13:42:34.175479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.854224Z","title":null,"venue":null,"work_id":"6ec72725-15a2-4c2a-a4c4-f3273ecbb5a4","year":2021},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.038884Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:f1e899b0935429362cbe018794924283aaf99a7308a5c84f122919bf7da40b7e","observation_id":"6310c7f4-3ba8-4fc0-bcd0-e43273fb5e01","resolution":{"observed_at":"2026-08-05T13:42:33.957244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.672317Z","title":null,"venue":null,"work_id":"4d9dc86e-c48e-42cc-b930-6e4f9fc99f02","year":2021},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.115800Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:841e5c59c7cfea0ca7118995430f32d6ada9ba23ecfd2efd5eff41c171b1a6e6","observation_id":"5a75df77-d674-49af-8aa5-1a7007c24541","resolution":{"observed_at":"2026-08-05T13:42:33.775286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:27.219802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.219802Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:e379806bd20bcfa2e73a378a3b76c37fc5c9d1861569e51d9217b0cbd03685f0","observation_id":"1858da30-ad44-4644-b2d6-33a296c7664e","resolution":{"observed_at":"2026-08-05T13:42:27.219802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.435521Z","title":null,"venue":null,"work_id":"62409362-c77a-43cc-aa23-1d480de7229d","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.325490Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:cceb94e03c48b6cefa9ebf560059d9b57f566c075403c4864e5fe0875bd2ab75","observation_id":"e33b9e5b-8a14-45c9-91e5-185a5831f4fc","resolution":{"observed_at":"2026-08-05T13:42:33.550312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.315405Z","title":null,"venue":null,"work_id":"22d0479c-2e8a-401a-aced-6dffbdbc6664","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.462268Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:bdfe52fb32c422585c89f5b5f1b26a6d8a716f8b3dd794684bcd32afb635afd9","observation_id":"5f53bc73-532b-48fd-a632-d703e01c71ba","resolution":{"observed_at":"2026-08-05T13:42:33.367520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.149369Z","title":null,"venue":null,"work_id":"a16f7c54-59a5-450d-bba8-f7c266696c8d","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.541723Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:0a2a7ad23cbd3e75b31f9ff20d31941857b3103aedd1ac012bfebe96c65a3c96","observation_id":"b94b5cbe-cc0b-4558-9749-fdc79c3181a6","resolution":{"observed_at":"2026-08-05T13:42:33.240837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-05T13:42:27.635378Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.635378Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:b5670c9f165c2a1854a992979933b8b8dbbb312c6564842fd9ac722650571041","observation_id":"a5556458-4547-43b2-8622-19b6cc050ee1","resolution":{"observed_at":"2026-08-05T13:42:27.635378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T13:42:27.728036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.728036Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d571fdd00428e16eb4a9e515e3df5e6b9a1065d6dc917dc20b4eebc5ba6d6883","observation_id":"2891eb46-dd02-4ca6-83e6-12703098abad","resolution":{"observed_at":"2026-08-05T13:42:27.728036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:27.805437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.805437Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:38ec8ed6d1e47759707a99e17077b2272449d21983b2ecc357bd03a1c93ea0a4","observation_id":"d0f5980a-123e-4b83-b2c3-a3d69785e456","resolution":{"observed_at":"2026-08-05T13:42:27.805437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.956877Z","title":null,"venue":null,"work_id":"a72a2c63-0a85-4c5f-9972-0d5208907060","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.886430Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:2f72b7f01f368eeb611181d6115eae83af8a72df3919aa335f286a2a45d32bc9","observation_id":"f5d9b632-2d99-4c96-bc62-58df3fb18d29","resolution":{"observed_at":"2026-08-05T13:42:33.035275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-05T13:42:27.944783Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.944783Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:552243eac267f16094757e260994609a271f4c127de4ea7d5a5644efe29d5bdd","observation_id":"10561fb1-d74c-4e84-a724-da5e72d258e5","resolution":{"observed_at":"2026-08-05T13:42:27.944783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.815451Z","title":null,"venue":null,"work_id":"da4532b8-87b7-49e1-afe3-635377188969","year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.044080Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:6e8a5ab27a7a903891aebb39aaa525c6077084b09a31613463581e489c7f7fef","observation_id":"45b5c767-8842-4af4-8e06-31814c83e787","resolution":{"observed_at":"2026-08-05T13:42:32.875298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T13:42:28.151533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.151533Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:09528f444f902741c0e7e56189e431d61e8e1521e75971f8e848798c81b52ec8","observation_id":"bd5ad8e8-fc81-48ee-a34e-24501979196a","resolution":{"observed_at":"2026-08-05T13:42:28.151533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.670427Z","title":null,"venue":null,"work_id":"9d590c70-3a6b-4ceb-aac4-f2ff4975ccb4","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.208271Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:f51f29e09a359fa5bcab3e7268ce861cd62526581d78d2303ec5758f273ee60c","observation_id":"3e564b3d-cf4c-499e-ac67-fe18c1b5b0d0","resolution":{"observed_at":"2026-08-05T13:42:32.740147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-05T13:42:28.293970Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.293970Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:7301f31231c4eef8083fa5b19dfdacff7abc452bdf918e55f1f630c70d8bf890","observation_id":"89509a5e-4f84-4017-9308-07e483a219ee","resolution":{"observed_at":"2026-08-05T13:42:28.293970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:28.410082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.410082Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:b16530d88c63df9a449c4b0f7e7b3b31567ee6696a289ae26774850c6344df97","observation_id":"049c161e-8a49-4b47-9290-ff795abedf9a","resolution":{"observed_at":"2026-08-05T13:42:28.410082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-05T13:42:28.502423Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.502423Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d8ee5b5d40a90bea4e480de021c4c06c0b85b055aad951b4f0363f9dcc12ff77","observation_id":"d6f26fe0-4e32-421e-a57d-cf143ef66f24","resolution":{"observed_at":"2026-08-05T13:42:28.502423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.509083Z","title":null,"venue":null,"work_id":"d8f4ae7e-4df1-443e-8779-362554739779","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.586105Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:e948f62c7e748c1a26e57ebe2caebcebc50d031d25864343ed1b84c430946b58","observation_id":"c6531b8d-3542-4a86-9833-35c90dc321a1","resolution":{"observed_at":"2026-08-05T13:42:32.576905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.274698Z","title":null,"venue":null,"work_id":"7b8f656f-a2da-4ee2-9f4b-5ca2eb3ac168","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.666125Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:5bced27e11940932e6c14f65963477eb2cbd4b1f0917bf7ed362db9d08c6d76e","observation_id":"2c558228-3dce-432e-9d48-c7a5414d3206","resolution":{"observed_at":"2026-08-05T13:42:32.417911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-05T13:42:28.758540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.758540Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d35aa79dc5c6e5011b42977bc74ecde44a086f4845af3adf73f555e231f43560","observation_id":"5538dd61-e472-4646-a6fe-73bfb96e193a","resolution":{"observed_at":"2026-08-05T13:42:28.758540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.016975Z","title":null,"venue":null,"work_id":"eddbccb0-4eb2-4a6c-b9c1-b0f164714048","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.844360Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ee2b3ad9baea466afe5091bcba5d0c9d06e1814952029c8d57d8edd629c1c6c6","observation_id":"eb9953f2-7e5b-4906-b8aa-4cfbb8fb392a","resolution":{"observed_at":"2026-08-05T13:42:32.133485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-10T17:10:48.855057Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-05T13:42:28.922349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.922349Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:4f6b7f6c0c29ee08bfe16f9f07a84dc579608b03d6fcc18ada9d9ffaacb2e236","observation_id":"a8b6add4-2c32-4340-9e76-eb965d4975ed","resolution":{"observed_at":"2026-08-05T13:42:28.922349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14439","last_updated":"2024-07-19T16:11:15Z","snapshot_observed_at":"2026-08-07T08:50:49.699503Z","submitted_at":"2024-07-19T16:11:15Z","title":"Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14439","snapshot_observed_at":"2026-08-05T13:42:29.008171Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.008171Z"},"links":{"cited_paper":"/paper/2407.14439","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:dd67ca7fa60838a93ad85abb9bb3269a13257afe1b113a3497a83691ec472887","observation_id":"0d467945-0623-4172-9ce8-608ec0c12b99","resolution":{"observed_at":"2026-08-05T13:42:29.008171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:31.705141Z","title":null,"venue":null,"work_id":"db4aa04d-8161-47ba-8d6f-644124d9e8f4","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.103943Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:1e4acb7948893f64b3b31b0aad099f04ae401d6ab180c366a2541bb03fbff93d","observation_id":"559511f1-0a75-4938-ab81-a3d6c7986e18","resolution":{"observed_at":"2026-08-05T13:42:31.870651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:31.354907Z","title":null,"venue":null,"work_id":"52276521-38ba-489a-beba-dbf0216efe9b","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.180607Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c14d2c066166a7f318ff58522a83565193f4fc07e958afe5de3d167d35fd03a0","observation_id":"5e0251c3-181a-43d3-8741-1daedf4f0dba","resolution":{"observed_at":"2026-08-05T13:42:31.511234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T13:42:29.264825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.264825Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ba8e58a7d9ace58fc2fae96162456a3c6df4083b523dc021dc6c32937d63d48a","observation_id":"2f0c0531-01f2-4bf4-8299-2aec7fa82cd7","resolution":{"observed_at":"2026-08-05T13:42:29.264825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":65,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 5 inbound Pith citation observations for arXiv:2509.00419."}