{"as_of":"2026-08-14T15:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c085f03fd9c1c7a7100c0b096ba0960ccc9e35aea3c21416e1bd5b2b823f9b1e","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:22:07.588062Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T11:13:49.266859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:39:42.103464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"cited_work":{"arxiv_id":"2411.15446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15446","snapshot_observed_at":"2026-07-04T08:39:42.103464Z","title":"freePruner: A training-free approach for large multi- modal model acceleration","venue":null,"work_id":"05bd33db-0bae-4456-ad38-2bc17f96e3bf","year":2024},"citing_paper":{"arxiv_id":"2605.17954","last_updated":"2026-05-18T07:09:46Z","snapshot_observed_at":"2026-08-14T01:26:15.840673Z","submitted_at":"2026-05-18T07:09:46Z","title":"A More Word-like Image Tokenization for MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T12:46:04.946489Z"},"links":{"cited_paper":"/paper/2411.15446","citing_paper":"/paper/2605.17954"},"observation_digest":"sha256:d9485b623bf5c302415626319bd50a457535600806b057586c46eff6be780643","observation_id":"af2b5615-992a-4597-bd0f-402399485595","resolution":{"observed_at":"2026-05-20T12:48:17.444765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"cited_work":{"arxiv_id":"2411.15446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15446","snapshot_observed_at":"2026-07-04T08:39:42.103464Z","title":"freePruner: A training-free approach for large multi- modal model acceleration","venue":null,"work_id":"05bd33db-0bae-4456-ad38-2bc17f96e3bf","year":2024},"citing_paper":{"arxiv_id":"2606.22352","last_updated":"2026-06-21T06:20:55Z","snapshot_observed_at":"2026-08-06T05:50:18.958153Z","submitted_at":"2026-06-21T06:20:55Z","title":"On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T11:13:49.266859Z"},"links":{"cited_paper":"/paper/2411.15446","citing_paper":"/paper/2606.22352"},"observation_digest":"sha256:26731731ae019b4118f9ea0b97196665c28ae90ca6718454666ec8bb96d77b77","observation_id":"8e83e1cc-20c7-4665-b65b-deb88e81a0c5","resolution":{"observed_at":"2026-07-04T08:39:42.104955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15446/citation-record","integrity":"/paper/2411.15446/integrity","json":"/paper/2411.15446/citation-record.json","paper":"/paper/2411.15446"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.568301Z","title":null,"venue":null,"work_id":"d839d3c6-4567-49f3-a601-006898aa013a","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.273546Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:52b89a7431754384c49ed066a29399f2328b4d022a37d428f8a45f516d7f57b3","observation_id":"0bf8cc7b-aef2-44f2-8218-fcf49d0fdabc","resolution":{"observed_at":"2026-08-12T14:22:08.571993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.556937Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"3e3af542-0126-40c6-b3b2-841d36451f87","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.278165Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:15e91d33c63e92fc357ded74b1d9801a4d543c0d79d2ccf62aa632660b5e9016","observation_id":"abdf8b63-4d22-460d-bcb1-b5c954637d88","resolution":{"observed_at":"2026-08-12T14:22:08.560911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-14T05:15:12.190552Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T14:22:07.282137Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.282137Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:919ecb8212efb128a336da0c945f3a55433ec7a8f7a7b2dc1d718095703df7ee","observation_id":"3d577f78-9146-49a3-aeae-4adfa1ab8f47","resolution":{"observed_at":"2026-08-12T14:22:07.282137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T14:22:07.286320Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.286320Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4d1e0ee414cd2349a6f449ec24d77601cb4f4955dd720e4c5ddf2f75e9d4703a","observation_id":"0326bd57-e697-4c4b-bfe5-2104572df3e2","resolution":{"observed_at":"2026-08-12T14:22:07.286320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-12T14:22:07.290005Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.290005Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6d704806c935260a29271ac71ee2feff6163da1152498b0401929cc5a74a8404","observation_id":"b6db6cf9-786f-4ee5-a678-9d924c6bd95e","resolution":{"observed_at":"2026-08-12T14:22:07.290005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.545803Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"d7cc3f8f-c58a-4425-8cee-0531a508b37b","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.294198Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:383e5ced1ddc54f1d910a1ea0b3d48e64c5a7c259dd39cb75d3b5a682ffbe7da","observation_id":"ce2c7d07-4aca-4899-8e92-a11e61b24411","resolution":{"observed_at":"2026-08-12T14:22:08.549697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.536151Z","title":"Meyer, Yuning Chai, Dennis Park, and Yong Jae Lee","venue":null,"work_id":"7bd5ebb3-b28d-49ae-9060-ab5a869478c5","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.297933Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:78b0ec0404ad0fe4c19e4186415066939ff2eb8611cd189758db85846be23b6f","observation_id":"1c0a72b2-efe8-42ca-ad5b-f5f609303266","resolution":{"observed_at":"2026-08-12T14:22:08.539409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.526219Z","title":"Coarse-to-fine sparse transformer for hyperspectral image re- construction","venue":null,"work_id":"6810a2db-2cd8-41b6-a105-f004624b3ae8","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.301786Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:de17082e011d12f8874109d534d906677eb2a9817d8c3e3a75882db0192b715c","observation_id":"64805e46-cd9c-4acb-baf9-689c2a0d3f80","resolution":{"observed_at":"2026-08-12T14:22:08.529873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T14:22:07.305202Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.305202Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:fef3b068395eb44ced0d8a5c030c8c32e98cbda9a6cb3d6fd77dbac868893298","observation_id":"80399462-c7f5-468c-adc6-b63e847fe2c1","resolution":{"observed_at":"2026-08-12T14:22:07.305202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.308933Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.308933Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:9f2f7b74082ac730faa85e628288b5d37aee74b2b6bf1912a13ef141af4c36c0","observation_id":"b68c2bbd-3911-4d4f-b479-955692a474c8","resolution":{"observed_at":"2026-08-12T14:22:07.308933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T14:22:07.312540Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.312540Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:ffe943ca6e559e3db2292a56c9ba754bfcd361f888d4d5ae31b2c0f2e8eb9384","observation_id":"5ad0558b-07f1-4407-a7fc-a158750c5ae9","resolution":{"observed_at":"2026-08-12T14:22:07.312540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-12T14:22:07.316401Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.316401Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:059a578cda72db237650b1b86a9dca1b5115c3fef761540f75625ec7c14aa74c","observation_id":"e85f311e-11d9-4e87-a90e-63cb0bb8ba69","resolution":{"observed_at":"2026-08-12T14:22:07.316401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.320004Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.320004Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7a765b1b76d729b1cf391e8431e2aa63010615235c32e6a9983b39a84216ba8e","observation_id":"e3a5527c-b1a9-48e8-b98f-9df3918f72c7","resolution":{"observed_at":"2026-08-12T14:22:07.320004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.501839Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":"c555382a-e2b6-4698-ba9a-03b943a38eee","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.323609Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:24a5acc609c07da1e76c2d119d1ab9755ecc70f6c4444702b8abc21213e77192","observation_id":"e5bcd0ac-4bc6-4fd6-8e20-3449357ecd1a","resolution":{"observed_at":"2026-08-12T14:22:08.505903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:22:07.327025Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.327025Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:204f075eca74d0f91a0d9344303da8610d5cf5cfb9911ec1b7c41c5aebe4e453","observation_id":"ee4ab44e-d5f6-4638-89ab-6e486774c4af","resolution":{"observed_at":"2026-08-12T14:22:07.327025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.490459Z","title":"Adaptive token sampling for efficient vision transformers","venue":null,"work_id":"7d178952-0a58-4eea-b7f3-afb7161e61ad","year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.330567Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:9497f1cb7e2f47f81fed5d3e301f4f6b28d4c7291b3737141c7b3ed11d5703ba","observation_id":"ebf6327e-36bd-4bf9-82af-e35279d4fa7c","resolution":{"observed_at":"2026-08-12T14:22:08.494221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-12T14:22:07.334323Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.334323Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:195b06536fa43a0688bb68b79544cf976fba8aaa14cd00bba5e417a47f68147c","observation_id":"183a75b9-1672-4838-9a7d-52bcb7aa8c99","resolution":{"observed_at":"2026-08-12T14:22:07.334323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T14:22:07.338146Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.338146Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7933ba4c6e4cf29c18001682af203018c231ff8270d5eee07d26c20ee66486cd","observation_id":"6d24d7c2-f79c-4533-8b75-8c4fb9b88dac","resolution":{"observed_at":"2026-08-12T14:22:07.338146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08944","last_updated":"2024-05-14T20:17:22Z","snapshot_observed_at":"2026-08-13T00:07:39.901086Z","submitted_at":"2024-05-14T20:17:22Z","title":"Challenges in Deploying Long-Context Transformers: A Theoretical Peak Performance Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08944","snapshot_observed_at":"2026-08-12T14:22:07.341700Z","title":"Challenges in deploying long-context transform- ers: A theoretical peak performance analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.341700Z"},"links":{"cited_paper":"/paper/2405.08944","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:087e12bdf78f737d3374155bfbc005da42d41ade146365b1463c8467ccc70100","observation_id":"1cda67c1-684a-4841-a613-afe8ad88f4e2","resolution":{"observed_at":"2026-08-12T14:22:07.341700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.345459Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.345459Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:03ac218cf0e8367281cf0c450ab49c69c1f137235e0ccd649ea02f013e22c558","observation_id":"36ae0581-7f6b-4d91-929c-9ba16718ecd4","resolution":{"observed_at":"2026-08-12T14:22:07.345459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.473936Z","title":"Which tokens to use? investi- gating token reduction in vision transformers","venue":null,"work_id":"0df36e83-7e6c-4d7a-953e-6390f42e70ec","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.348907Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7a304d4a4c2ee1642524612eac14e9e85b0c248d52ea9b52984c569cf4d18a60","observation_id":"d82f2e2c-0521-45a0-a0a2-0489fb7499ae","resolution":{"observed_at":"2026-08-12T14:22:08.477789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.463264Z","title":"3d-llm: Inject- ing the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":"1fea988a-2d60-4446-9e92-af56d68273f0","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.352351Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:199bcc7af96bb0771ee4a84984907a98e81f8fbebe25ed160ad286075aa46b7f","observation_id":"4684aa1d-a075-4eac-9431-a8866dde8d17","resolution":{"observed_at":"2026-08-12T14:22:08.467104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T14:22:07.355666Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.355666Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:899f2dfca9065e414ee85908469158348e16e3cd3d7f88cbf3c343c59f36403b","observation_id":"75edc326-98be-410d-9c02-c15bde83314b","resolution":{"observed_at":"2026-08-12T14:22:07.355666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.359703Z","title":"Efficient multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.359703Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:0cb9ca33f035c1a759959c6ab53e0c3089dfaeb5ec23d6e35dd6ce8886d9579e","observation_id":"e1fd311e-914b-42da-8b66-56ef207a95a6","resolution":{"observed_at":"2026-08-12T14:22:07.359703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17863","last_updated":"2024-02-27T19:54:42Z","snapshot_observed_at":"2026-08-13T13:35:34.361478Z","submitted_at":"2024-02-27T19:54:42Z","title":"Vision Transformers with Natural Language Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17863","snapshot_observed_at":"2026-08-12T14:22:07.371863Z","title":"Vision transformers with natural language seman- tics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.371863Z"},"links":{"cited_paper":"/paper/2402.17863","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:765adc5e2b917285f18805f47509e927a2b1b24b2a48bebc5304d6bd62e32668","observation_id":"f3abac6f-7a9f-43cb-ba93-79b754b0ce6b","resolution":{"observed_at":"2026-08-12T14:22:07.371863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T14:22:07.377105Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.377105Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:b26b638510abb67da9e6c8ed8274d7c717c58b8bcbe2923cea06635724526e5e","observation_id":"34b33b84-a249-4ac0-a9c2-68a84fab5ef4","resolution":{"observed_at":"2026-08-12T14:22:07.377105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.451943Z","title":null,"venue":null,"work_id":"fb3cd79f-883b-4a61-8b6b-b4414b1e3514","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.381908Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:677e5d2d7d512d51461e246471d764c4c6706c195da9511afc618360ea079b5e","observation_id":"a7ec506e-1364-4cb6-8fef-03a38b7bcf36","resolution":{"observed_at":"2026-08-12T14:22:08.456382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-12T14:22:07.386710Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.386710Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:fd15593c72f6324b341ee278765fa3c2c4beccaab8b4ad1ac49ef3510ecf316a","observation_id":"f0a986b0-1320-418f-be09-e018279d5e4d","resolution":{"observed_at":"2026-08-12T14:22:07.386710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T14:22:07.391779Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.391779Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:35553e5d99495dd4ebd77812bc393e8d80f377798d1b91b594f5733f7bf6cfa9","observation_id":"b7a8f6f2-28be-4ff5-913a-f094ef0b19c6","resolution":{"observed_at":"2026-08-12T14:22:07.391779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-13T16:40:03.706852Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-12T14:22:07.396842Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.396842Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:1dc73f3a32778a09192080735249e847a937f4db18e929fa5854d939b3c261e5","observation_id":"ea32277f-f74c-4b96-8501-641d1f696574","resolution":{"observed_at":"2026-08-12T14:22:07.396842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.440725Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"a50939a5-1701-45b9-a126-8eaed63522af","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.401612Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:abdbc85bf0cdb8abff9df0e6baa5a77bcea7cd45c1830d663f2db73d1d914c56","observation_id":"4a8f3929-8780-4d8d-b9d2-7d3476037877","resolution":{"observed_at":"2026-08-12T14:22:08.444371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.406136Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.406136Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:bc84fe5ee434a30dc583abc1847ec159e5ce77e06eddfb4488f818c88e795f21","observation_id":"09977cc5-f999-46c9-973b-344db8ac30ea","resolution":{"observed_at":"2026-08-12T14:22:07.406136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20210","last_updated":"2024-10-26T16:00:38Z","snapshot_observed_at":"2026-08-14T06:20:40.575125Z","submitted_at":"2024-10-26T16:00:38Z","title":"Looking Beyond The Top-1: Transformers Determine Top Tokens In Order","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20210","snapshot_observed_at":"2026-08-12T14:22:07.411170Z","title":"Looking beyond the top-1: Trans- formers determine top tokens in order","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.411170Z"},"links":{"cited_paper":"/paper/2410.20210","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:044f187ca7e8cb1166a0056f8ce93feb2cab63644ede413ba9dfee7f4253fb4d","observation_id":"60435166-9c5d-4f04-ac31-c5c09e920dca","resolution":{"observed_at":"2026-08-12T14:22:07.411170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.416931Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.416931Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:f3f153d6d0fd4284a80be527038fdb53590ad60396fdf756f83fd26270ee68ab","observation_id":"91750a97-14ce-4536-8d10-d8cd33409556","resolution":{"observed_at":"2026-08-12T14:22:07.416931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.416169Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge","venue":null,"work_id":"9ab55076-0f46-4c84-8baa-90ec8b3a8fde","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.421398Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:d5f1c4b72c8f2ab5f2d9c0e5abdfca81a3338162f5ac4676f95e42e8c9e21721","observation_id":"53632313-9bfc-48bf-95fd-949d17e3e7e9","resolution":{"observed_at":"2026-08-12T14:22:08.420345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.405436Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"579b2c35-c4a9-4f8a-901f-da6ff7519974","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.426185Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:34bfd2a83ee407793ba6a682971354b5e0b8534dd4ede5f8f593defc99c92f42","observation_id":"fd7cb6c4-f436-4e49-bf67-9f11d1d33ef0","resolution":{"observed_at":"2026-08-12T14:22:08.409142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T14:22:07.430811Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.430811Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:242a70dee67a33521af8d2a72d37a70bc6a35c30a40d4b23743a14bb60bfd289","observation_id":"8c546c66-7c97-4723-9b46-d1a7ae3c17c9","resolution":{"observed_at":"2026-08-12T14:22:07.430811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-12T14:22:07.435597Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.435597Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7f3d490df902a28024a6f69a005af449844ced9352bff5cfb702b3cc04a2825d","observation_id":"615d776e-a0c8-4bba-ab72-cf6d543da630","resolution":{"observed_at":"2026-08-12T14:22:07.435597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13802","last_updated":"2023-07-06T10:49:33Z","snapshot_observed_at":"2026-08-13T14:18:02.587438Z","submitted_at":"2022-09-28T03:07:32Z","title":"Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully Exploiting Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13802","snapshot_observed_at":"2026-08-12T14:22:07.440191Z","title":"Adaptive sparse vit: Towards learnable adaptive token pruning by fully exploiting self-attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.440191Z"},"links":{"cited_paper":"/paper/2209.13802","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:89841436352f937033c04b17daf025d71065f3e08ae646e2e36f29480ddde080","observation_id":"c4207409-16a7-4de0-a389-0ee3bb088653","resolution":{"observed_at":"2026-08-12T14:22:07.440191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T14:22:07.444846Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.444846Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:3f3080cc4eb3668a98055970d46859c05007b2b746b9d82d20c3d936da75f817","observation_id":"b89fd827-8ebf-46f7-953d-d92c22f8c340","resolution":{"observed_at":"2026-08-12T14:22:07.444846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.393435Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"95deb140-b79b-4591-a0cf-ab4c55556c60","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.448657Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:13e842f2557d85eb286839fecedb82a471060bbc3fb3692ffab2337133ad9049","observation_id":"8fb85cb8-4519-46d1-b5c8-e6cbb98f41e7","resolution":{"observed_at":"2026-08-12T14:22:08.398107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.382884Z","title":"Gpt-4 technical report","venue":null,"work_id":"093a0a09-c978-471c-8360-96d1afa75777","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.453099Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7b822f82269315b78aa7a55baa9045940b6861ea15aa445edc6d282c081f6e96","observation_id":"52ab48fb-89c4-4c8a-ba26-2281ce1d11d2","resolution":{"observed_at":"2026-08-12T14:22:08.386542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.457058Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.457058Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:1ac896c72cfa9fe4d7513c98cb931a116fac7becb85ee15558af171cefe55ca7","observation_id":"3f8400f6-8ed3-4e29-bca1-5f87e93384ba","resolution":{"observed_at":"2026-08-12T14:22:07.457058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T14:22:07.462074Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.462074Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:ccda455f983700208bb50de0e09fb6df2f4a3c2c3d1f018e48ea31909b8131e7","observation_id":"524a78d8-3900-4af5-af7e-a50431a87409","resolution":{"observed_at":"2026-08-12T14:22:07.462074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-08-13T01:33:21.194051Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-12T14:22:07.467056Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.467056Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4863c36e31a35eb45261755d4ec28464ecb2fd00a8630166a6465f54f746e140","observation_id":"a636e3c2-b084-4079-94cd-9a3fa2de403d","resolution":{"observed_at":"2026-08-12T14:22:07.467056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.471159Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.471159Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:19f5a3c9e0268a542b2e5f3140d2f00874429163f086213d5804a96fce181b5e","observation_id":"4eb7ce5c-0b20-487b-aa28-f9ff26e1347d","resolution":{"observed_at":"2026-08-12T14:22:07.471159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.365082Z","title":"Enhancing post-training quantization calibration through contrastive learning","venue":null,"work_id":"cfee997f-0e8d-4939-8c86-c7d4df9abb9e","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.475258Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:5c61c9234cd56873c6bc113e330fe503bf923b08cf6cc7077fcf46d2a0353c8e","observation_id":"b0c00712-cda3-47b7-8534-17468feb3153","resolution":{"observed_at":"2026-08-12T14:22:08.368904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12963","last_updated":"2024-10-02T01:56:08Z","snapshot_observed_at":"2026-08-12T22:41:32.284756Z","submitted_at":"2024-09-19T17:59:55Z","title":"Interpolating Video-LLMs: Toward Longer-sequence LMMs in a Training-free Manner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12963","snapshot_observed_at":"2026-08-12T14:22:07.479797Z","title":"Interpolating video-llms: Toward longer- sequence lmms in a training-free manner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.479797Z"},"links":{"cited_paper":"/paper/2409.12963","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:1babc2149732ea03e31c61fa2a84579c167f0b7bc6aa784741fba14973a9d55d","observation_id":"aa91d93a-1bb4-4454-9e95-c751b41c9caa","resolution":{"observed_at":"2026-08-12T14:22:07.479797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00034","last_updated":"2023-11-07T20:41:22Z","snapshot_observed_at":"2026-08-13T10:02:10.987700Z","submitted_at":"2023-09-29T14:35:27Z","title":"PB-LLM: Partially Binarized Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00034","snapshot_observed_at":"2026-08-12T14:22:07.484737Z","title":"Pb-llm: Partially binarized large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.484737Z"},"links":{"cited_paper":"/paper/2310.00034","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:a51cbc06e3a66b9686ca256b83d8cca92ab24d90995d03e2698f93861118c944","observation_id":"f64d4ffe-cee7-4430-8aab-148c89293e88","resolution":{"observed_at":"2026-08-12T14:22:07.484737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.353443Z","title":"Crossget: Cross-guided ensem- ble of tokens for accelerating vision-language transformers","venue":null,"work_id":"95aa66b7-ac1f-4ae0-b22c-93037f624961","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.489713Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:2adfe4df3024258fb9da5635206a81d07b955ba03cd31705f673a290f2396337","observation_id":"4be06d13-8e3d-4042-a2ab-11f695fe7a6b","resolution":{"observed_at":"2026-08-12T14:22:08.357511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.341901Z","title":"Towards vqa models that can read","venue":null,"work_id":"8b7aa397-69fc-4dfd-9450-c0ba1e55344f","year":2019},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.494014Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:29873fd6cf30ef0235052f3ff303a7279f3c4d268cf6202e9bb0a24ddb195057","observation_id":"86bf74f5-5ae9-4bb6-84c1-e72090c10f30","resolution":{"observed_at":"2026-08-12T14:22:08.345964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-12T14:22:07.498433Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.498433Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e8ebe117d18217d677757615327c1bc26ab3915319918a83e938d5532cc20973","observation_id":"f1611754-88d6-4d73-ae1f-864d6fad6ea6","resolution":{"observed_at":"2026-08-12T14:22:07.498433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.331378Z","title":"Efficient transformers: A survey","venue":null,"work_id":"11cfb2c1-13e1-484e-8f37-27c81f607de6","year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.503181Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:2809ff1f326f41638671807c2d81b7241b884a31f3498a631c4c356daddc9f56","observation_id":"75a6f077-4f62-4fa4-bb32-36853f06a15d","resolution":{"observed_at":"2026-08-12T14:22:08.334930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T14:22:07.509001Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.509001Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:1a63950477d12277cb631b8aa83a15606d5a810c3638b373b8c3972bf37e6fb0","observation_id":"d1b0608a-d6e1-4d95-9fec-bf9567e0d07a","resolution":{"observed_at":"2026-08-12T14:22:07.509001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T14:22:07.513552Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.513552Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4f74a2c17a16a6e7d9becd61bc6e2948ad264b0dcf1c26756be22f81688c5f3f","observation_id":"fa0a8102-e27e-4d51-8fa7-3ad160f8f6a8","resolution":{"observed_at":"2026-08-12T14:22:07.513552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.517792Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.517792Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:f13692dc927b93c728224b908e0643ac477b929723e8f63fae1e20fa7ba246ad","observation_id":"63e2dfd5-3fb6-4f76-9cf8-358c8eef45ad","resolution":{"observed_at":"2026-08-12T14:22:07.517792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08119","last_updated":"2025-02-24T01:36:56Z","snapshot_observed_at":"2026-08-12T22:26:07.251909Z","submitted_at":"2024-10-10T17:02:48Z","title":"Q-VLM: Post-training Quantization for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08119","snapshot_observed_at":"2026-08-12T14:22:07.522594Z","title":"Q-vlm: Post-training quanti- zation for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.522594Z"},"links":{"cited_paper":"/paper/2410.08119","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:690031e3c81acba24479a96ae3bf9b786bf57d7ff90e5deb72d8a146dc66dfcd","observation_id":"4b6105b5-2fad-4e47-af70-bdfeb2fc0dc9","resolution":{"observed_at":"2026-08-12T14:22:07.522594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.527373Z","title":"Sclip: Rethinking self-attention for dense vision-language inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.527373Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:0a72d67eaec840bc70b6625f52d71cb957468561e70aa1479c3507709a7122e7","observation_id":"90e90d60-a74b-49a3-b008-ecc8afbc6032","resolution":{"observed_at":"2026-08-12T14:22:07.527373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T14:22:07.531733Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.531733Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e4d5c5f92ba9bc40c2fcfbeacfa7bf68203f7e27d1305246e825b7784c643fa8","observation_id":"8001ab3f-1911-4190-a5e8-c82a24cfc92c","resolution":{"observed_at":"2026-08-12T14:22:07.531733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T14:22:07.541318Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.541318Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6b855e6545f1027ba7f32c1d4a2fbd53fe9f8c7e46b2a869241536587b6bb835","observation_id":"6af6ad4f-3ed4-4563-b721-2c04d2d9b6e5","resolution":{"observed_at":"2026-08-12T14:22:07.541318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.306293Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"07fd63b0-b2a4-4cd6-8c29-4d6c5813a2fb","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.545638Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:ea926cceb3c975aee1aeb5ca434f5b000bef469fd257753517e866b582b4d310","observation_id":"655dc8d9-985a-4d15-b725-3e93bb003e00","resolution":{"observed_at":"2026-08-12T14:22:08.310293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-12T14:22:07.549762Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.549762Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4fc19a8716ca140123fad6bbaacd073326f7782b2dc1cbecaf58a34b9c8db690","observation_id":"672dcb6b-6388-4f48-a2e4-605474ccb604","resolution":{"observed_at":"2026-08-12T14:22:07.549762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-13T04:10:18.599255Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-12T14:22:07.553844Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.553844Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:ae5610865e5b9e07c977168ecfa2015f5acb4aa3a5ccd52919488f9dced01fa3","observation_id":"a482768a-b8b3-48bd-88d2-0c4eb5f6a86e","resolution":{"observed_at":"2026-08-12T14:22:07.553844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-13T04:35:22.207759Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-12T14:22:07.558219Z","title":"Mm-llms: Recent ad- vances in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.558219Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:1c4235218480779f40a6bbb7b707b2f45f9e37a11e8ae1fa30662d09834e88ff","observation_id":"27dd53b5-5e3b-490d-a891-ba47f2466071","resolution":{"observed_at":"2026-08-12T14:22:07.558219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T14:22:07.561704Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.561704Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:f070f63b6f944483c177c7d4b025e44c13f19df0cc828da53a1a346515d3f558","observation_id":"dcb90463-83c0-40a1-a7bd-ddf8b86cf343","resolution":{"observed_at":"2026-08-12T14:22:07.561704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14439","last_updated":"2024-07-19T16:11:15Z","snapshot_observed_at":"2026-08-12T23:18:31.345577Z","submitted_at":"2024-07-19T16:11:15Z","title":"Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14439","snapshot_observed_at":"2026-08-12T14:22:07.566043Z","title":"Token-level correlation-guided com- pression for efficient multimodal document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.566043Z"},"links":{"cited_paper":"/paper/2407.14439","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:0c71a49fbb56d9241b00a4206a6af527dc84aa687ddad58adafa07298c90aedf","observation_id":"640e2fd8-87c2-4780-babe-e733c10aa0fb","resolution":{"observed_at":"2026-08-12T14:22:07.566043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-13T11:00:14.993256Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-12T14:22:07.570328Z","title":"Gpt4roi: In- struction tuning large language model on region-of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.570328Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4c44d76cd2a5c6f4c6d3e3ab234cc591c399c5a8e55d732504e32c14c277d66c","observation_id":"abbd4e5a-9db2-4616-b8cb-943ca9ecc495","resolution":{"observed_at":"2026-08-12T14:22:07.570328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.295952Z","title":"Extract free dense labels from clip","venue":null,"work_id":"eac774bf-6e2f-40f6-bfa4-6d89c8c8b35a","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.575011Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:9c76c9bfafb806ba97c95ef664b2c155bc31d3597d56a8d9ceb1bdfe14401e7f","observation_id":"ff96a273-4dd6-46a1-884a-a5cb555065ca","resolution":{"observed_at":"2026-08-12T14:22:08.299391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-14T03:13:25.123360Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-12T14:22:07.579546Z","title":"Languagebind: Extending video-language pretrain- ing to n-modality by language-based semantic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.579546Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:a150884ec62962c1e92b1f25cda0784b3d8a96d52009b30e834190343e93a67b","observation_id":"9cee5ab1-1327-4570-8edc-b26e0b9bc1e1","resolution":{"observed_at":"2026-08-12T14:22:07.579546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T14:22:07.584148Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.584148Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:cd80f956302e87fcb498ea4de078822f5089d606f5da1bb40c6018262352023a","observation_id":"18310075-e217-4b61-802f-b67a256a483a","resolution":{"observed_at":"2026-08-12T14:22:07.584148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.282610Z","title":"Orthogonal Method with Post-training Quan- tization on LLMs Table 4","venue":null,"work_id":"0af89754-2a05-47c9-a511-8359e749d351","year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.588062Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:fc880b4145f214b3721ca9bfaccd514a99bfd05dfa06c0d1ddc7789babab528d","observation_id":"7319a30e-4cb1-46fd-b9d8-a5e734dba8b9","resolution":{"observed_at":"2026-08-12T14:22:08.288171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:40:59.774695Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2411.15446."}