{"as_of":"2026-08-21T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3db048ab1cb79b0b192145edbfddaf40c654b1f40cba07b39523e180c82e26a8","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:21:52.377583Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:12:56.131001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:18:37.366607Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19509","snapshot_observed_at":"2026-08-09T19:12:56.131001Z","title":"arXiv:2412.19509 [cs.CV] https://arxiv.org/abs/2412.19509","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00425","last_updated":"2025-08-10T04:13:03Z","snapshot_observed_at":"2026-08-17T14:07:15.133393Z","submitted_at":"2025-02-01T13:08:02Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T19:12:56.131001Z"},"links":{"cited_paper":"/paper/2412.19509","citing_paper":"/paper/2502.00425"},"observation_digest":"sha256:b3b78c65379409757d71acc0630406e2ee5cbb984fe81261c32277494e5eb87d","observation_id":"ed410a1c-caa0-4802-9fcd-db2d6b9c6bf6","resolution":{"observed_at":"2026-08-09T19:12:56.131001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2412.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19509","snapshot_observed_at":"2026-07-03T16:18:37.366607Z","title":"Mbq: Modality- balanced quantization for large vision-language models,","venue":null,"work_id":"d2fd5b15-2b9a-4133-ad6c-67f771252776","year":2025},"citing_paper":{"arxiv_id":"2606.00535","last_updated":"2026-05-30T05:05:24Z","snapshot_observed_at":"2026-08-16T00:43:44.943332Z","submitted_at":"2026-05-30T05:05:24Z","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T18:55:51.474956Z"},"links":{"cited_paper":"/paper/2412.19509","citing_paper":"/paper/2606.00535"},"observation_digest":"sha256:3ca0655ed9d19aaef8285188300e3e9a257a28ae220760c12548bd412486e6d5","observation_id":"a21d352c-9f33-497b-9c6f-b426317f3ed6","resolution":{"observed_at":"2026-06-28T19:02:34.572979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2412.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19509","snapshot_observed_at":"2026-07-03T16:18:37.366607Z","title":"Mbq: Modality- balanced quantization for large vision-language models,","venue":null,"work_id":"d2fd5b15-2b9a-4133-ad6c-67f771252776","year":2025},"citing_paper":{"arxiv_id":"2606.00573","last_updated":"2026-05-30T06:53:23Z","snapshot_observed_at":"2026-08-16T03:38:46.307266Z","submitted_at":"2026-05-30T06:53:23Z","title":"LASER: Loss-Aware Singular-value Decomposition and Rank Allocation for Efficient Low-Precision Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T19:09:29.347284Z"},"links":{"cited_paper":"/paper/2412.19509","citing_paper":"/paper/2606.00573"},"observation_digest":"sha256:2230cacd00f014fe8fbed1161b046b636dda8752761465b7a3f211fb06a6a64c","observation_id":"96b75b99-8981-44aa-b58e-d14b31774a73","resolution":{"observed_at":"2026-06-28T19:12:34.712644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2412.19509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19509","snapshot_observed_at":"2026-07-03T16:18:37.366607Z","title":"Mbq: Modality- balanced quantization for large vision-language models,","venue":null,"work_id":"d2fd5b15-2b9a-4133-ad6c-67f771252776","year":2025},"citing_paper":{"arxiv_id":"2607.01876","last_updated":"2026-07-02T08:30:00Z","snapshot_observed_at":"2026-08-18T11:02:21.120012Z","submitted_at":"2026-07-02T08:30:00Z","title":"SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-03T16:14:03.717787Z"},"links":{"cited_paper":"/paper/2412.19509","citing_paper":"/paper/2607.01876"},"observation_digest":"sha256:c38724254fa7c4eb71e56319311a3d4c65328ae9ce70c42bf2a8765b4bb5d299","observation_id":"95409af6-cc6c-4d04-8135-01f72d2376a3","resolution":{"observed_at":"2026-07-03T16:18:37.368114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19509/citation-record","integrity":"/paper/2412.19509/integrity","json":"/paper/2412.19509/citation-record.json","paper":"/paper/2412.19509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.105585Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.105585Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:46790daf8ebaf0eb10d073679fa70b1d278faa72737b836369bf104b154d15c4","observation_id":"2ccd005e-c2e7-4511-bd86-d3ef88c200f8","resolution":{"observed_at":"2026-08-11T00:21:52.105585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.110703Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.110703Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:52f17827acccdc57691725f29d7e847be72a5da4805fbf618d7e11b50c4f7f48","observation_id":"e8f2e767-f845-4a23-854d-5852311f48d1","resolution":{"observed_at":"2026-08-11T00:21:52.110703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-16T14:04:57.666315Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-11T00:21:52.115070Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.115070Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:da6df75196a4e39795e897fbe764fecc5329586c4b9cb3fd0865249fcc16b01f","observation_id":"af04e1b6-f081-448d-9815-fc87e0416989","resolution":{"observed_at":"2026-08-11T00:21:52.115070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T00:21:52.120684Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.120684Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:a60d04323fdb688d93494f612b1fea152769f4db5b80eb6c6b64349d23418ff3","observation_id":"78b32ce7-ef0b-4309-9ad8-d0918eff8080","resolution":{"observed_at":"2026-08-11T00:21:52.120684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T00:21:52.125017Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.125017Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:a447b827bb7bab19f75df744ed7bd87b0041f022d96e39d324d24753d8a3c89f","observation_id":"8a62efcc-4947-44b1-9d88-508cdefd994f","resolution":{"observed_at":"2026-08-11T00:21:52.125017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.474113Z","title":"Madtp: Multi- modal alignment-guided dynamic token pruning for accel- erating vision-language transformer","venue":null,"work_id":"620161e1-5ce6-4c9c-adba-3fd6a6520a76","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.129207Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:c57b2bfdd98b5e5c304064afd281ee516dcb80b8fd07b3d35ff24869bb797f71","observation_id":"18e799cc-3e96-4d80-bad7-3be4a4b751a9","resolution":{"observed_at":"2026-08-11T00:21:53.478870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.460557Z","title":"Quip: 2-bit quantization of large language models with guarantees","venue":null,"work_id":"32562799-7c14-4001-b616-3bca08529471","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.133190Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:e21037eca2bd00616e180c87267eadcf066115bd208f3bfb1e51440a3f02f2f2","observation_id":"2f70b025-08aa-45a6-86e5-f71421afb842","resolution":{"observed_at":"2026-08-11T00:21:53.464849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T00:21:52.137468Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.137468Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:c95098535a3bb0fc1b77dd12603b5edad0b01b796621a1d6c8cfe8638ff75d84","observation_id":"4649ac03-06bf-4d4e-a620-172b4beb1571","resolution":{"observed_at":"2026-08-11T00:21:52.137468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.445409Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"9e969e13-858e-4c39-8b13-641af6231aa2","year":2025},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.141610Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:f485a23091c51de6a1035ab39759c9fc2d76e6f85e685d06d4a305af297ecce2","observation_id":"6ff507a7-7fdc-46ce-9903-dc28985ad3b3","resolution":{"observed_at":"2026-08-11T00:21:53.450320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T00:21:52.145313Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.145313Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:af731a85daf3c3caccc28201fd928543656c988f70e6bb2dd37dee358a0106e4","observation_id":"ab70f971-27a1-43e3-847c-74cbf10be103","resolution":{"observed_at":"2026-08-11T00:21:52.145313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.430581Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"f76a74f4-5144-4bd0-83ac-75ff9c6518be","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.149879Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:9965486b81d1b777331d7a06aecb4224588c827868f16b256590de37c888d920","observation_id":"3fa41131-0df4-46ab-997e-05de94b2030e","resolution":{"observed_at":"2026-08-11T00:21:53.435429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-08-21T10:53:34.016934Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-11T00:21:52.154461Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.154461Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:9d4b6f385deb47afe0583cbe5d2402914601b6a6b4aa3646081e4280c945f7f5","observation_id":"87bd6ebe-a169-4823-a15a-41161d57b92b","resolution":{"observed_at":"2026-08-11T00:21:52.154461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-11T00:21:52.159156Z","title":"Flashattention-2: Faster attention with bet- ter parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.159156Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:4209b69669b39e73cf58959f4506d62abb5a025b13472e05b54394946fffc97d","observation_id":"0527c9fd-9b03-416e-ba9c-4a9ca20110e1","resolution":{"observed_at":"2026-08-11T00:21:52.159156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-19T14:44:54.976757Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-11T00:21:52.163502Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.163502Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:6d5b32ee88031e1e3622c68e9323faba8aee8e905f19380e39e3ac5fafabbff3","observation_id":"a81c7215-b073-4b70-a25e-9b81be08aff8","resolution":{"observed_at":"2026-08-11T00:21:52.163502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-11T00:21:52.168181Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.168181Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:9aa0f8a5cac95d549c3f4799b1614e49f6af49a9d8098ecb97401cfc905861f1","observation_id":"0c08c9cf-1851-4048-a4b3-a95242fd1e98","resolution":{"observed_at":"2026-08-11T00:21:52.168181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.172820Z","title":"Moa: Mixture of sparse attention for automatic large language model compression.arXiv preprint arXiv:2406.14909, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.172820Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:e8d4a642ab775df6c7e90927dea083cc358ce42b985c0fd718bed571a9824f0f","observation_id":"1f9b97e6-56b7-4c7a-9ed8-26436026e99c","resolution":{"observed_at":"2026-08-11T00:21:52.172820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-11T00:21:52.177269Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.177269Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:5c0605946246b34f11ae6ea09f6470660a2ab12ae554e403611af69b8f938053","observation_id":"c2f72d89-ac3b-4c8f-8360-2ca3d5b06f43","resolution":{"observed_at":"2026-08-11T00:21:52.177269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.182684Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.182684Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:5c88225b7354dc05702912f48b79142dc2ed2183e4b6c3c499b59257e34e31ba","observation_id":"fc66d3c8-698b-4521-a5a1-ea89041de2cb","resolution":{"observed_at":"2026-08-11T00:21:52.182684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T00:21:52.187123Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.187123Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:5b39ba293d6ca1fe5a7fac1e723be6f2da06a044def3c637badd540e2671ef8f","observation_id":"80130e5f-f41b-416d-aeaa-6b63ddd9dc19","resolution":{"observed_at":"2026-08-11T00:21:52.187123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.406127Z","title":"Llava-next: Stronger llms supercharge multimodal capa- bilities in the wild, 2024","venue":null,"work_id":"57bd9f7d-a584-4096-a3a8-6801ffcf1aa6","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.191778Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:53a4797a1cbcdfa9c55e33c35da82e6905684d7ff8f890449527d30a03db3e0c","observation_id":"298ad498-c48f-42f5-9415-68f218437624","resolution":{"observed_at":"2026-08-11T00:21:53.411165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:21:52.195975Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.195975Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:d9645914b22bb091079791e7694c448af43590a324c2e741678e9d2f38c9b061","observation_id":"00ee3d80-6cce-4d23-a9b5-4a1f09edcb9d","resolution":{"observed_at":"2026-08-11T00:21:52.195975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.200549Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.200549Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:bb7ed361c4b426e84f7bf2b7e7cd741556b36b49a14e0104f18a9b891d8b9c21","observation_id":"a71ab9fc-5a5e-4ef9-862b-b3fea50e9344","resolution":{"observed_at":"2026-08-11T00:21:52.200549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.380950Z","title":"Llm-mq: Mixed-precision quantiza- tion for efficient llm deployment","venue":null,"work_id":"efc812c7-d627-4068-bc44-f30ea8fa7d3a","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.204809Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:fbf6392ad6f98bc4fcb19f9f86288f4b4dfdd95001747f45be840471c996fba9","observation_id":"5492805a-4c72-4c41-aa82-6a7a0658dcf1","resolution":{"observed_at":"2026-08-11T00:21:53.386113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.365178Z","title":"Evaluating quantized large language models","venue":null,"work_id":"3a8d50e0-2548-482b-b2fc-2765afb0b6b6","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.209140Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:2126436c22fbf56aa30f954c5b6bd81765eccc377685a8902e2dbfb20f2e3c34","observation_id":"7e8fcf70-d007-408d-8ef1-4d849fa730ed","resolution":{"observed_at":"2026-08-11T00:21:53.370020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-11T00:21:52.213328Z","title":"Eagle: Speculative sampling requires rethinking feature un- certainty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.213328Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:282145d6b202e2412a9193938edf1522e83d0c933a713687512f5f075f074af9","observation_id":"0e393eaf-cb02-4872-bcfd-40bf8cff4b9d","resolution":{"observed_at":"2026-08-11T00:21:52.213328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-18T21:21:26.158966Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-11T00:21:52.217708Z","title":"Moe-llava: Mixture of experts for large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.217708Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:9af35365ecab739c2f2ad39c94a087a96aa6d3e81155576b620018361cb2faea","observation_id":"457cc0aa-c337-4925-99da-fc2f404f3bf1","resolution":{"observed_at":"2026-08-11T00:21:52.217708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.349906Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":"5cf47209-56ac-4806-9517-d373f1cd6cf9","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.221996Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:4b51de0d4e2c053a128a5bd7912632e4731b423e6d1eee172f1a0f045ac22b71","observation_id":"eb250ba1-e5e7-4766-9cd1-548bb4100176","resolution":{"observed_at":"2026-08-11T00:21:53.354930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.226055Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.226055Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:909a67dd4a85127118e47f223eff0eabd402c98d5ef4036d3b96299febdfe93a","observation_id":"e5e05113-4ff1-48e2-8401-565607cab953","resolution":{"observed_at":"2026-08-11T00:21:52.226055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-19T14:44:32.329439Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-11T00:21:52.229717Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.229717Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:675f79feeea5a6a276c7de088b3b2194107a6bf932d957fe07380e33a420eaa7","observation_id":"1248ba68-d2f8-48eb-9cc1-147a40f1b0af","resolution":{"observed_at":"2026-08-11T00:21:52.229717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05803","last_updated":"2025-01-25T15:59:57Z","snapshot_observed_at":"2026-08-18T12:43:24.860402Z","submitted_at":"2024-05-09T14:38:53Z","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05803","snapshot_observed_at":"2026-08-11T00:21:52.233673Z","title":"Boosting multimodal large language models with visual tokens withdrawal for rapid inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.233673Z"},"links":{"cited_paper":"/paper/2405.05803","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:c297d3c6a1bc04e26c35c22250c620865c76514f79dd705f2fb19e3cd765199a","observation_id":"e31ec82e-f815-4370-bf47-b7610183a5ff","resolution":{"observed_at":"2026-08-11T00:21:52.233673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.323848Z","title":"Visual instruction tuning","venue":null,"work_id":"1f753808-a754-4654-8087-efc27348c201","year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.237690Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:ac980a091b5a8048c027b29bf61dec44ef9faeaeda6ef0ab064c7348d1ee9eef","observation_id":"c6f2fe14-8d04-457a-83c6-f411447120fc","resolution":{"observed_at":"2026-08-11T00:21:53.328362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.309728Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models, 2024","venue":null,"work_id":"93d98524-fae8-4197-b0e5-b86d97255f08","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.241932Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:1c6f0d6a4d7e083c798e1e1d7b2f90afbe2bc2c29a8e009ebaaadfc5a678dc08","observation_id":"f6438b1d-8b42-40fa-bbe1-d64fc72be943","resolution":{"observed_at":"2026-08-11T00:21:53.313941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-08-16T17:18:05.876361Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-11T00:21:52.246328Z","title":"Spinquant–llm quantization with learned rotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.246328Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:7168ebe28dc2d883b51a60d5c2135e37400512e0f2023a56538827c3f7f02613","observation_id":"b7552357-7818-412b-ae44-394082910cfa","resolution":{"observed_at":"2026-08-11T00:21:52.246328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.294806Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"e2656545-75b5-407e-9ca5-c1a76a108794","year":2022},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.251680Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:cd739076009440663ec7404219dc4bed883411974b9511913c40538080c47dfd","observation_id":"d6e2d7be-32a6-4958-a20e-3651839a077c","resolution":{"observed_at":"2026-08-11T00:21:53.299425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-11T00:21:52.255831Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.255831Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:74dad18cf3bdfcb23feedb575049957a7c52fb42234ce005ca74f508a34a94f0","observation_id":"fc5e0330-9cfa-46ee-9090-0804226388ec","resolution":{"observed_at":"2026-08-11T00:21:52.255831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.280351Z","title":"Skeleton-of-thought: Prompting llms for efficient parallel generation","venue":null,"work_id":"89aa08ee-6800-4deb-8595-c10b7915f929","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.260834Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:9bc96060748976484bf5617bdeab6c727bd42817f94371bedf29cdd542accabc","observation_id":"999bfc33-81c3-4292-91f9-62db3437da67","resolution":{"observed_at":"2026-08-11T00:21:53.285355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-08-16T14:08:01.486505Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-11T00:21:52.265439Z","title":"Vl-mamba: Ex- ploring state space models for multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.265439Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:fd323aa64a8ecd330b7cfc9a92b52ce6f7231873e14dddfa5017275a40b2603a","observation_id":"87dfa7f9-5307-44c3-b52d-374d49bd534e","resolution":{"observed_at":"2026-08-11T00:21:52.265439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.269865Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.269865Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:f469f6b62b8a2e3b7a7a0bed6337ae02e2d9efccd6654ca3721e19769c80dea2","observation_id":"f595520b-1b07-41a3-a7cf-a5541f737394","resolution":{"observed_at":"2026-08-11T00:21:52.269865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-19T19:41:30.005565Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-11T00:21:52.274118Z","title":"Omniquant: Omnidirectionally calibrated quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.274118Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:c4f57107c663633e43f0660c72ab2278a40f021ae88b5d46a6c1d76b15d5a285","observation_id":"d7a20f75-d9d6-46fa-9a54-149ee760f6ab","resolution":{"observed_at":"2026-08-11T00:21:52.274118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.264608Z","title":"Towards vqa models that can read","venue":null,"work_id":"419705c4-a717-486d-9b66-16123a032f35","year":2019},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.278599Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:352ad238dcf997a176d51f98e1f921dd525f4d64d02900d24edfdaf3324a4e4c","observation_id":"ec444c70-24b4-43c2-a44e-a7bb796c0678","resolution":{"observed_at":"2026-08-11T00:21:53.270017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09426","last_updated":"2025-08-10T14:08:54Z","snapshot_observed_at":"2026-08-16T13:10:06.311790Z","submitted_at":"2024-10-12T08:10:28Z","title":"FlatQuant: Flatness Matters for LLM Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09426","snapshot_observed_at":"2026-08-11T00:21:52.282753Z","title":"Flatquant: Flatness matters for llm quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.282753Z"},"links":{"cited_paper":"/paper/2410.09426","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:a90a69a8a9ac1b42314cfc472995759466df26966b91f6e55213bdc50914557a","observation_id":"84f6cc41-98bc-4567-8db8-f5aa81e0f34e","resolution":{"observed_at":"2026-08-11T00:21:52.282753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.287293Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.287293Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:925c93303cb8d0ece53b2a627de3c4b38b2463d1f6ce66e35462fd18b1d1a09b","observation_id":"63b7a57d-0ecd-4844-8583-3ab40b3369d3","resolution":{"observed_at":"2026-08-11T00:21:52.287293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.240760Z","title":"Smoothquant: Accurate and effi- cient post-training quantization for large language models","venue":null,"work_id":"42234a98-b1a6-4449-9a2b-98f727c3b229","year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.291453Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:4d4e1b2d8dc0faaeab405f46521ca436f4227cde502cee83e5288938c2b0ea21","observation_id":"0999704a-26e5-418d-9632-184d2537b9a9","resolution":{"observed_at":"2026-08-11T00:21:53.245362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-20T09:03:18.402041Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-11T00:21:52.295904Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.295904Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:2b327a45226697a98c539108a287ddbaf290c047addaff7da6629ef49f9107ac","observation_id":"bb5e6cbd-ce04-42d2-8e04-52df6428f9a5","resolution":{"observed_at":"2026-08-11T00:21:52.295904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-19T05:29:03.467497Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T00:21:52.300528Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.300528Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:2e4ea583df1c2002fd6c9f5d413419bfcd1b5aa687ada6f1b94e6f57b69c957d","observation_id":"ca19e749-1942-4d8e-87fb-4d3f901b9cce","resolution":{"observed_at":"2026-08-11T00:21:52.300528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08302","last_updated":"2023-05-26T00:17:06Z","snapshot_observed_at":"2026-08-16T15:48:09.692405Z","submitted_at":"2023-03-15T01:27:15Z","title":"ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08302","snapshot_observed_at":"2026-08-11T00:21:52.305041Z","title":"Zeroquant-v2: Exploring post-training quantization in llms from comprehensive study to low rank compensation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.305041Z"},"links":{"cited_paper":"/paper/2303.08302","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:19d1d5669ed3ed934e7b8b3a1cc5504645e256dd9ab645d1d25e04172193458e","observation_id":"e13bac50-265a-49da-8a76-8133c812febf","resolution":{"observed_at":"2026-08-11T00:21:52.305041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.225966Z","title":"Mmmu: A massive multi-discipline mul- timodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"1efe32d3-eff6-47c1-8af7-5a544bc44624","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.309090Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:cbaa1c3378eb614ab99517dcec6fb7e7847dddc99a850e10e265f7cba1514083","observation_id":"f1f7cbd6-4511-47d1-a7eb-990d43074858","resolution":{"observed_at":"2026-08-11T00:21:53.230644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:52.312700Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.312700Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:0b23d881a0648cf5b415dc916e2cb9bab95218f680442233d8398c51c7e09bb6","observation_id":"92f982ef-741a-470e-9b61-2fe9c039edb3","resolution":{"observed_at":"2026-08-11T00:21:52.312700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.201285Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":"9ee3e0b1-1616-432b-8f92-34431b9ddf44","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.317025Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:476a2a8a1cb0283c99de4142cc59f71bfeef2d28e72d2b83f29bd3d0d90e3b3f","observation_id":"b95bd41c-7765-48b4-953f-85419d44d3b8","resolution":{"observed_at":"2026-08-11T00:21:53.205977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.188107Z","title":"Debi- asing multimodal large language models","venue":null,"work_id":"5443b3c5-0eca-49e3-95c3-ce1b5c09d857","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.320617Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:c6c95b4a45474812c4d0589a6ed3d6aace4890d1ff4e37539ebf97158e448a91","observation_id":"3af66ba1-ac2d-419c-b818-cf3e37abc2ac","resolution":{"observed_at":"2026-08-11T00:21:53.192263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.173551Z","title":"H2o: Heavy-hitter ora- cle for efficient generative inference of large language mod- els","venue":null,"work_id":"bdc6f8f5-ea37-4c2f-95a4-407d2d5d8793","year":2023},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.324291Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:073cc37b652a5b54b33961ff66ac794a39504acb7d0b8de8b3d4fa93bd659514","observation_id":"13e58d4b-495e-40be-ab0f-72f490fca7d7","resolution":{"observed_at":"2026-08-11T00:21:53.178261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14520","last_updated":"2025-01-08T11:03:00Z","snapshot_observed_at":"2026-08-16T14:07:37.083558Z","submitted_at":"2024-03-21T16:17:57Z","title":"Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14520","snapshot_observed_at":"2026-08-11T00:21:52.328600Z","title":"Cobra: Extending mamba to multi-modal large language model for efficient inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.328600Z"},"links":{"cited_paper":"/paper/2403.14520","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:bd33bc71049a6ed39e9cc816ede8488be6257925bb99e9b26686dbcd7d4b2afd","observation_id":"7b56f215-0911-45c3-8102-17d9289bdd3a","resolution":{"observed_at":"2026-08-11T00:21:52.328600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.158902Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving","venue":null,"work_id":"e6cc2145-88e7-4214-8445-80a5dfa5475f","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.332913Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:6f3bf8c532e649919b20763a433aadb81f68c56394cefe6f386ed1c871f223ec","observation_id":"aa11f565-5bc6-4306-853e-cbbd9ca7db2e","resolution":{"observed_at":"2026-08-11T00:21:53.163852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-11T00:21:52.336947Z","title":"A survey on efficient inference for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.336947Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:9a99dc6de30c15b36ea996c2372b74b7b1437e39910a89245881d218386efe3a","observation_id":"968423d1-a085-480d-974d-62db0ea1534b","resolution":{"observed_at":"2026-08-11T00:21:52.336947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.144066Z","title":"Llava-phi: Efficient multi-modal as- sistant with small language model, 2024","venue":null,"work_id":"42bb5830-ea67-4e0b-b2e4-fa4ca11c4245","year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.341302Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:2ca17130476f1e60f9a16f30fa7f4ed1589b814e16b584041b515738198bf7d7","observation_id":"a67f440b-5e8c-4cb4-89e8-23d5b4647d28","resolution":{"observed_at":"2026-08-11T00:21:53.149037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.129837Z","title":"The Inference Process of VLMs The inference process of VLMs is shown in Fig","venue":null,"work_id":"913ad3b8-3988-4d79-aa7f-199fb84722ff","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.345353Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:0c674d7e360233027f8c53b9dd2eb227dc0d4afe554099da3988c30dad0d9288","observation_id":"1b8a54a9-3e88-4268-9074-7d3abfb44a92","resolution":{"observed_at":"2026-08-11T00:21:53.134311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.114026Z","title":"LLM Quantization Post-Training Quantization (PTQ) techniques are widely used in LLMs to accelerate the inference process","venue":null,"work_id":"49523bbe-dde3-4233-8834-bf072114891a","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.349657Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:195e7fdc8200fef5877f64b0692c73213de9ba3f24fcedcb7cd94a6459155f8c","observation_id":"d82b6987-bed0-405f-b22f-4d2aff834e60","resolution":{"observed_at":"2026-08-11T00:21:53.119372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.095564Z","title":"W4A16 and W8A8 Results on Large VLMs As shown in Tab","venue":null,"work_id":"6de7fe14-54bb-4d47-8fca-aac0b4a5d80d","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.354164Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:4082131c07c694227612a066c39ab15a45863ae2113f1269ddf4a7d9e6251b58","observation_id":"2b75c01d-38d6-41ae-84f3-e19e94dd071d","resolution":{"observed_at":"2026-08-11T00:21:53.102289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.079374Z","title":null,"venue":null,"work_id":"3c230b63-f121-40f4-bd2a-71757914fd26","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.359493Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:1e2a68a58dfe1a6cdcb3d0e63aad6531f50ed7b4255c3c439d35b18b27faf470","observation_id":"87b1608f-7d4c-4052-be24-b5c0131895ec","resolution":{"observed_at":"2026-08-11T00:21:53.084796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.064272Z","title":null,"venue":null,"work_id":"8b30c8de-957c-4e69-a4a1-32ee64e58a64","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.364020Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:c2edda99e18cc50132c72f7b07b505b1da32abbeb3e81285de81c093d81cb845","observation_id":"50a5ff3d-43dd-42e9-bfb1-2d8e8d236efd","resolution":{"observed_at":"2026-08-11T00:21:53.068672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.050019Z","title":null,"venue":null,"work_id":"e4832e71-7003-47c8-afec-586c5d9ffba5","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.368471Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:e3abaaaefe8f7ee41e65764fbf3afeaac063915d046e295c5b9e747d4b0c681b","observation_id":"30f51fb5-687d-40c2-b914-3f0bbb37c015","resolution":{"observed_at":"2026-08-11T00:21:53.054182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.034483Z","title":null,"venue":null,"work_id":"85c10172-6ebb-4947-b05e-f8b2a5d15fde","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.373114Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:1b4692c078972ec67831ba92d0006148ea0f2466f24902def26fa00dabefd4ba","observation_id":"94d6c4e6-3ad1-4783-a0cb-4fb8dcde253c","resolution":{"observed_at":"2026-08-11T00:21:53.039055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:53.018019Z","title":"No Output","venue":null,"work_id":"b4ba3d2f-28f1-412c-b53e-5d9c60daa7a1","year":null},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.377583Z"},"links":{"citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:90e7088a0f307c3f3bc962a9c8c5d2ceab13829bd825e0ce55e27d5b7912d635","observation_id":"21771865-8bd4-4057-b2af-4dd4a109a19f","resolution":{"observed_at":"2026-08-11T00:21:53.023986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T00:33:19.218843Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 4 inbound Pith citation observations for arXiv:2412.19509."}