{"as_of":"2026-08-12T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8548cba281924619efb4d1a6b9d40ed7f906ef51394995314829bc33821cb35","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:56.294364Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:44:37.884895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:11:02.504431Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-08-02T23:44:37.884895Z","title":"arXiv preprint arXiv:2505.14260 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12957","last_updated":"2026-06-29T06:43:50Z","snapshot_observed_at":"2026-08-04T00:07:49.527953Z","submitted_at":"2026-02-13T14:22:10Z","title":"HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T23:44:37.884895Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2602.12957"},"observation_digest":"sha256:2869286211a8f504732d1eb1b64f5b8fd9a88109a116b1589893563148682b87","observation_id":"d950a3a3-52f9-4710-9137-a53eeb6e7b30","resolution":{"observed_at":"2026-08-02T23:44:37.884895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Speculative decoding reimagined for multimodal large language models.arXiv preprint arXiv:2505.14260, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-11T07:58:12.956235Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:1d933620d7ab767f96df13d64dd86a9e95c510452d4da7a18e3298d1a938b43b","observation_id":"8ef8e9bd-1a19-4d4c-a9c4-16e926bbd613","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.14260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.14260 (2025)","venue":null,"work_id":"5c9b5923-8857-4616-9141-9e1d583c92ec","year":2025},"citing_paper":{"arxiv_id":"2604.09731","last_updated":"2026-06-30T01:27:13Z","snapshot_observed_at":"2026-08-06T01:39:37.713323Z","submitted_at":"2026-04-09T13:17:56Z","title":"SMART: When is it Actually Worth Expanding a Speculative Tree?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:47:57.421156Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2604.09731"},"observation_digest":"sha256:ea6be5245580ed17535a4256c3311030498b1799b5486f0c8591c59b20d57f14","observation_id":"2212655e-0e7c-4a7f-b6d1-3393eb50a814","resolution":{"observed_at":"2026-05-11T08:11:02.508599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-08-02T01:48:52.479619Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-07T01:49:31.068808Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:52.479619Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:e20c576e8d67b95af4b94834161afd5a1a51b971956d1ea55c54aea2c81f5964","observation_id":"a35dae9a-87f5-42d7-8f24-55aeac61e1b2","resolution":{"observed_at":"2026-08-02T01:48:52.479619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14260/citation-record","integrity":"/paper/2505.14260/integrity","json":"/paper/2505.14260/citation-record.json","paper":"/paper/2505.14260"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.526818Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"7fafd948-c362-4ab6-ab83-b9f0b68b29db","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.002187Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:52d4e53f481da348fd9faee432022190773d0d3932f61458349afed4a9bec408","observation_id":"2dd385fe-9b0d-445d-b8f1-cc68bc70f85e","resolution":{"observed_at":"2026-08-07T15:43:05.607827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.294739Z","title":"Sharegpt","venue":null,"work_id":"4c2a5e61-b90c-411a-b6d1-9d488e8544f5","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.078322Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:c189175103ddc701216ca99abd23485075741a2eb509e5ca9e291c940d00635b","observation_id":"7f67eed2-59f5-48e5-991c-cd46b061895c","resolution":{"observed_at":"2026-08-07T15:43:05.438602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.026981Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":"2868ec9b-2f8c-41f4-8f5b-c45c67e4baf9","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.179436Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:32c7d2adb90e34384803065dde2e4c3f888d1799e49705631660c347640b0b90","observation_id":"e6927f43-8e81-4274-8bf4-258444046e7f","resolution":{"observed_at":"2026-08-07T15:43:05.149539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.850613Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"49184fb4-9714-493c-811a-28b37203bf61","year":2025},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.248582Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:e311651553d897393d1232941d0c68ecf5e86db2d088ae2603385209f7b19a57","observation_id":"965a96a4-3d00-4de6-ab69-719b76398cba","resolution":{"observed_at":"2026-08-07T15:43:04.929426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.564454Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":"fef85c27-680b-41be-b2be-71b28c31357d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.378487Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:0eee8e07d94c5c7c54383edd8e78886d00b8ea423b0ae1966722edc77d8fcc99","observation_id":"8a5d4887-01d3-4a29-a57d-195b85dab7ac","resolution":{"observed_at":"2026-08-07T15:43:04.679671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.396553Z","title":"Madtp: Multimodal alignment-guided dynamic token pruning for accelerating vision-language transformer","venue":null,"work_id":"d65b0970-862c-435e-b13c-84d492130a10","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.477020Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:0b94d342168084e606708a039ebe076e966d5732a4f91015d6265630b168a339","observation_id":"eb9916d6-7160-437e-ab3b-039bc1341d38","resolution":{"observed_at":"2026-08-07T15:43:04.486357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11049","last_updated":"2025-04-02T01:58:38Z","snapshot_observed_at":"2026-08-10T13:50:00.390063Z","submitted_at":"2024-08-20T17:57:31Z","title":"MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11049","snapshot_observed_at":"2026-08-07T15:42:51.603894Z","title":"Magicdec: Breaking the latency-throughput tradeoff for long context generation with speculative decoding.arXiv preprint arXiv:2408.11049, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.603894Z"},"links":{"cited_paper":"/paper/2408.11049","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:f63ee4dea9f6458db79d0564965900d7e2edef8464e487380c0c6ef55832e22e","observation_id":"2f28a232-067d-40cb-b824-62a0df9bdbc0","resolution":{"observed_at":"2026-08-07T15:42:51.603894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.216812Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"78111d38-bed8-409c-b57d-67fca085173d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.758861Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:c399892131391798794949b016779a42b111f5f5be46de2426a144e2f115bbc8","observation_id":"d2cb13a1-3cfb-4125-9508-c2cb4afd6868","resolution":{"observed_at":"2026-08-07T15:43:04.308827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.973855Z","title":"Diffrate : Differentiable compression rate for efficient vision transformers","venue":null,"work_id":"435551b1-85d9-4804-8750-9dd87b51cfc1","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.856526Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:4dda909139392e245abcc5bdbbcf562ab4b5ea871f18d51a2919a80374e78029","observation_id":"8472b815-8778-4719-b53a-e657fa0b0a88","resolution":{"observed_at":"2026-08-07T15:43:04.090731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T15:42:51.998002Z","title":"Evalu- ating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.998002Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:5a9197d9c2b377872d8016f870445ea616e18391a9ea5dd8d0e1d43d5d205d8c","observation_id":"5971ae9b-2c20-4fff-85ce-4694e2f964cf","resolution":{"observed_at":"2026-08-07T15:42:51.998002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T15:42:52.140080Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.140080Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:0f9646a436ba1f619b271828c30d2b820fa5889b4262e11132783896408cbc7b","observation_id":"cc6f647b-2343-4021-b403-87dbb174dd76","resolution":{"observed_at":"2026-08-07T15:42:52.140080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.269586Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.269586Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d2b7263e15dcc5d4349fee796d24b8cf6a8add45f0e3af0e64bdc78cc40dd0b6","observation_id":"a1a6d5c4-a8c2-4b6b-a810-159e414f5e6d","resolution":{"observed_at":"2026-08-07T15:42:52.269586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:42:52.384747Z","title":"Train- ing verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.384747Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:399b80dcf4c1d92d295f9c7a5a9064513bb6b1d8f09deacbe9cfca8d1e8c5529","observation_id":"35311bcf-9417-48ea-8de5-2a63cfc3d0a1","resolution":{"observed_at":"2026-08-07T15:42:52.384747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.809460Z","title":"Flashattention-2: Faster attention with better paral- lelism and work partitioning","venue":null,"work_id":"c5611a66-b749-47bb-bd3b-f31a65d0a51a","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.520459Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d94a44e8556a711aafec2cc84829ad8cfd22fdbe4a5341d005687ddb83549b1a","observation_id":"607f0ff6-625e-4e48-b6a0-4c393f4a9d1d","resolution":{"observed_at":"2026-08-07T15:43:03.902246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.521662Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"060f8e02-0bb4-4e1e-9a3b-9865fb91d1ed","year":2022},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.654998Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ffdf29e57e80c8a442cf7f918556c53a2f8db09a7b943c5d07442d96498f9c04","observation_id":"2cca68c7-34f7-4400-a9b6-cb1ffa537e3d","resolution":{"observed_at":"2026-08-07T15:43:03.688863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.359595Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2023","venue":null,"work_id":"1db6db4b-0965-4b83-b97b-7420c947de32","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.766877Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:3105d51b84bc068dd4800ac9a668195e5c03f6e0d894c485e26013747d9188b1","observation_id":"46f9dfcc-1f41-458f-8b67-45ad1b2ab7f0","resolution":{"observed_at":"2026-08-07T15:43:03.454182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02057","last_updated":"2024-02-03T06:37:50Z","snapshot_observed_at":"2026-08-10T01:13:58.065889Z","submitted_at":"2024-02-03T06:37:50Z","title":"Break the Sequential Dependency of LLM Inference Using Lookahead Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02057","snapshot_observed_at":"2026-08-07T15:42:52.964039Z","title":"Break the sequential dependency of llm inference using lookahead decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.964039Z"},"links":{"cited_paper":"/paper/2402.02057","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:1a03a688d969009ba5633cb7f90843ec27394946148f9d875e9e5c258caaadde","observation_id":"40c1840c-6422-42a9-9344-4dacfb33782b","resolution":{"observed_at":"2026-08-07T15:42:52.964039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.179028Z","title":"On speculative de- coding for multimodal large language models, 2024","venue":null,"work_id":"442b7d8f-f11a-443c-8545-d6073feafb63","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.096692Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:aabbc0e990b6a2c904cc1543cc88dc495978534d8d9a92caa276a405d0d67c17","observation_id":"db0aa4eb-b18e-4dcd-9db6-1983100197a2","resolution":{"observed_at":"2026-08-07T15:43:03.284745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.045531Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"c0611a14-3903-40e7-8b15-b8e6943b02eb","year":2017},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.184615Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:e65ac6f82ac2745bad1a05fd3b2745a0c2869758f47e44246cfb088a79be71b2","observation_id":"e8600f12-c8e8-4e6d-bf18-324907bf2c49","resolution":{"observed_at":"2026-08-07T15:43:03.107501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.793799Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"865fa195-4051-4282-9500-29fa581e64a0","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.273506Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:5853f44fbe06de81f213300330ad37623d4b50b0b782d01e87b68447eea9711e","observation_id":"e755fa42-dd18-4317-a2b3-9d9c1240456e","resolution":{"observed_at":"2026-08-07T15:43:02.878228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.463707Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"5e1d1621-8032-4da9-9550-4fd3ae2da0da","year":2016},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.386578Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:9e73799e5f4e39adb1ffaf8df1e10057b0fd27faac00eae6512ad3145964e3cb","observation_id":"00150653-8d2e-4abe-93b2-8d56c5ad849c","resolution":{"observed_at":"2026-08-07T15:43:02.615171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.215636Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"e1406124-e67d-4085-a90e-81b55dbdf471","year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.502385Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ca4c7bb1acbcd23f3a3aee485abe2a75abe77e91e0a53ae468a4348fb0f3a742","observation_id":"e581eb29-484a-4097-97be-101792a256b0","resolution":{"observed_at":"2026-08-07T15:43:02.306653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.974874Z","title":"Fast in- ference from transformers via speculative decoding, 2023","venue":null,"work_id":"f9f0d072-36c3-48fd-a940-fd1a7ab9c537","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.602320Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:31f8088a3fe16119f6d172e5cf4f115e25812668049cb52afa6aa44e598f115a","observation_id":"df04763c-b5f0-4827-aee5-b89b7354b870","resolution":{"observed_at":"2026-08-07T15:43:02.079645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.770231Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"90d141c7-58b6-4a47-a405-bdbf1be95716","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.666871Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d6bf533051b738f291aed72474780e21fbe98a6221e1c92e958677151d43b49c","observation_id":"a7c93abb-242d-4d10-bde5-3d0554f5ef1d","resolution":{"observed_at":"2026-08-07T15:43:01.815404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.496568Z","title":"Mbq: Modality-balanced quantization for large vision-language models, 2025","venue":null,"work_id":"b2606f53-5d4a-4abe-9295-4fc086094be7","year":2025},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.769305Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:2fde85cf0e5576e674efcb912a36f67febb4378de97ee74f9896d2b80ea34a0b","observation_id":"21f14983-b513-4013-aeb5-2932a222da6a","resolution":{"observed_at":"2026-08-07T15:43:01.617127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.258690Z","title":"Tokenpacker: Efficient visual projector for multimodal llm, 2024","venue":null,"work_id":"0e48a61e-ac50-4b1c-8e88-a69df8b73e10","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.976045Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:62969b2567d9c5423d651729e40239c917e95fe952aa0636d51d028d679f2771","observation_id":"5240c826-d93f-4cdd-824b-a258b39e2219","resolution":{"observed_at":"2026-08-07T15:43:01.352493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.034746Z","title":"EAGLE-2: Faster inference of language models with dy- namic draft trees","venue":null,"work_id":"2267d38c-34c9-4298-9843-9b628515474e","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.072661Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d68dcaefc886466d34d24419242bd54db800ad3bc31ebec4810861346de5caa9","observation_id":"67046b93-e169-4e1e-96d0-0e3727a4473c","resolution":{"observed_at":"2026-08-07T15:43:01.132549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.844742Z","title":"EAGLE: Speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":"3ff6815b-a5e3-4b0c-bacc-18e61af1fcf3","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.172704Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:92557e682ae57c0bff284a3d156bcc8952ce765e8b1d7e502b15704f9a77ba13","observation_id":"44eecb0f-c787-40ae-a6bb-4606fbfc0afe","resolution":{"observed_at":"2026-08-07T15:43:00.916324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-07T15:42:54.275560Z","title":"Moe-llava: Mixture of experts for large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.275560Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:4132265b340de96fd04e891ec459e03eec0e26f3065a90b3725bad1472b5e1c7","observation_id":"e58f0841-c3dd-4168-914c-81caba70ba05","resolution":{"observed_at":"2026-08-07T15:42:54.275560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.686916Z","title":"Boosting multimodal large language models with visual to- kens withdrawal for rapid inference","venue":null,"work_id":"3c124c84-317d-4415-a25b-f21caaaf5936","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.379762Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:8e61ceb99097e99c770803c6ea29cffa5c083428f37d790fd039ed89d0e87d4d","observation_id":"fb07f3c9-5560-4d84-ae63-8a5668afcedc","resolution":{"observed_at":"2026-08-07T15:43:00.756646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.467204Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"ef3ce3b6-f592-40ef-99c9-2b8a1fc1e62e","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.468070Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:46c3d64f828047b67cbfdac251dbd90b3ce46f5d706fb76831524423e1663521","observation_id":"7329108f-1ae6-449f-965e-d2f725a69bb8","resolution":{"observed_at":"2026-08-07T15:43:00.538357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.300959Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"d11f2316-994d-48ce-9d17-ea0076e409be","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.618384Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:a5d5fd5bc6a0770a13e53b7e11acb61decc5c6d1bb613357fd3ba12a00135a54","observation_id":"35094642-eb29-49a9-8ad5-976e6191ee16","resolution":{"observed_at":"2026-08-07T15:43:00.419555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.004831Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2023","venue":null,"work_id":"34fb1669-430d-4c4a-8f96-560293b47464","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.717220Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:c5352974f8b3b52b5f0a5b8ccad7885368b2a1455795acc73115659a0fc21644","observation_id":"6220cd67-de78-4ac0-81a0-8e3d457447ef","resolution":{"observed_at":"2026-08-07T15:43:00.118135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.753624Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"6d3f0088-8787-4f4f-a63c-f12fc6461fd2","year":2022},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.806172Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:a650c93dacccdad8f94510678639e8792666ff4ac701b8d25890d70ad88f2da3","observation_id":"986fedbd-0afd-4107-8494-be3dbdc3aad6","resolution":{"observed_at":"2026-08-07T15:42:59.857099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.551659Z","title":"ChartQA: A benchmark for question an- swering about charts with visual and logical reasoning","venue":null,"work_id":"2062fdf9-5ed9-4bb2-b05b-a771ce12c19a","year":2022},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.900842Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:b1b08039749470db379715838e7405f4f5b3e1d4af987c415157559bfa8e65f6","observation_id":"207bbc7e-f974-421d-8697-829ca8da4c0a","resolution":{"observed_at":"2026-08-07T15:42:59.680608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.301458Z","title":"Mm1: Methods, analysis and in- sights from multimodal llm pre-training","venue":null,"work_id":"2f63efd4-621c-4674-b688-255527f3c03d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.018726Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:cc332603a5e480e38486fcccdd86b59c1574388785182b146d0c47fafc2e9060","observation_id":"53475137-9217-4efa-b2a9-87ad353e4469","resolution":{"observed_at":"2026-08-07T15:42:59.426790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:55.084527Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.084527Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:fbdc65994ff978f28989a5402dcf19b9975b42c7e6cf5005eca28b89b85b89bf","observation_id":"e5507623-85a9-4fa1-848a-c3647f6cdb67","resolution":{"observed_at":"2026-08-07T15:42:55.084527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.917304Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"91642d07-621e-4df9-933b-459a9a3bf14f","year":2021},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.175992Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:bcc51bc0d3d079e6db618231182aa263d51cc779ca16c28ac352c75764926313","observation_id":"b7bc08e0-ec7a-4491-a807-8c5a8b5bdafb","resolution":{"observed_at":"2026-08-07T15:42:59.052147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.678151Z","title":"Crossget: cross-guided ensem- ble of tokens for accelerating vision-language transformers","venue":null,"work_id":"114b9734-27f2-4774-bfd5-1af3d4985207","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.378336Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:5285b5df2a3c2f7e1acffb51ff2f7dbf17e6f531e829d025ab3211d35ab14724","observation_id":"19239ca9-9e8a-4aa9-9123-15b289b32672","resolution":{"observed_at":"2026-08-07T15:42:58.783792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.435280Z","title":"Towards vqa models that can read","venue":null,"work_id":"71aa4a84-7c24-4385-a9f0-e508f9a0e07c","year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.483714Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:a3f314b5eef9119c05099f67f39cd4875ab5df252cc76947b9b7887ec48f3a37","observation_id":"f628e393-4091-47fc-9b2e-6495cd4a7187","resolution":{"observed_at":"2026-08-07T15:42:58.567691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.067940Z","title":"Gemini: A family of highly capable multimodal models, 2023","venue":null,"work_id":"ffa99e3a-626d-434d-8b2e-6a88140c1216","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.579960Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:13ecd4bbcafc724096d608f91d875af057c43ae10a0af4353a81f0dce873ab7c","observation_id":"174f5246-7735-4a63-9e22-aa1561093d9a","resolution":{"observed_at":"2026-08-07T15:42:58.189988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08119","last_updated":"2025-02-24T01:36:56Z","snapshot_observed_at":"2026-07-06T19:31:18.802964Z","submitted_at":"2024-10-10T17:02:48Z","title":"Q-VLM: Post-training Quantization for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08119","snapshot_observed_at":"2026-08-07T15:42:55.672801Z","title":"Q-vlm: Post-training quanti- zation for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.672801Z"},"links":{"cited_paper":"/paper/2410.08119","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:51badf27fe010e13819d8e7f5136a5bf1bb1e61d222390041930b5c03bf0acec","observation_id":"f5c3e04f-90a1-43b1-a083-a396502bbb87","resolution":{"observed_at":"2026-08-07T15:42:55.672801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.755742Z","title":"Large multimodal model compression via iterative efficient prun- ing and distillation","venue":null,"work_id":"fb087333-9b4b-4960-9c4f-3d3313d510c3","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.730004Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:0e76d4273242f953ca2fe619b2916fbaee8c0dbe39094a35ce3ecddef59ace87","observation_id":"625280b5-3ea4-4d1a-a6bc-a95f5059fee9","resolution":{"observed_at":"2026-08-07T15:42:57.935490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.578393Z","title":"Ppt: Token pruning and pooling for efficient vision transformers, 2023","venue":null,"work_id":"15f8c008-9620-4870-8a86-71bc591eab03","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.802858Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:1f86c6fb4e47afd5d333a7f8e1ce9d10d28a1b916b451ec47d5d4f9927344f58","observation_id":"92345a1f-c526-408b-bc67-86134a9b672a","resolution":{"observed_at":"2026-08-07T15:42:57.686430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.299400Z","title":"mplug-owl: Modularization empowers large language mod- els with multimodality, 2024","venue":null,"work_id":"ea6efa87-7f77-40d7-b91e-846b6498f803","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.863908Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:21719eef012ba98aab46a9ca3feeb60d2fe84cf6fcf25be40c0a8317217722bd","observation_id":"3af64a77-fdc8-47e3-9376-1d68bc731d99","resolution":{"observed_at":"2026-08-07T15:42:57.404553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.986877Z","title":"Generation meets verification: Accel- erating large language model inference with smart parallel auto-correct decoding","venue":null,"work_id":"9e7b1295-1d54-43d1-9fb7-6c7ca613995d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.955642Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:4b739006a994aa56edf336596e10fd9afd321fc14cdf93123217a95c6f1236b0","observation_id":"be0b5308-a3d3-45b4-bce2-be9e6adb24a8","resolution":{"observed_at":"2026-08-07T15:42:57.136593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.895864Z","title":"Draft& verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":"4364a810-0588-446e-a341-feb3a4bcaa56","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.015580Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ee37c39c458c12e00c2960dbd6433fc131e5e7fc4b9606b70e32d8e03857a1bb","observation_id":"a7e61b52-b387-400e-abea-ad29daf30a8e","resolution":{"observed_at":"2026-08-07T15:42:56.950279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.737856Z","title":"Learning harmonized representations for speculative sampling, 2024","venue":null,"work_id":"88b49d3f-6c80-4643-8625-e98ee6430881","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.084348Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:2ee2767daf8b243d850f2bd4f8baf9246bcf29e2f11e9c371ea625bb55aef0ab","observation_id":"da12a79a-721c-4b19-83ec-cd7f8a09eda0","resolution":{"observed_at":"2026-08-07T15:42:56.802116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.615854Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"d269b04e-4e39-497f-b0dc-c1fe32d877b9","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.141651Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:2a9d57c53eddb5ea9d285f1ff060c31faaccf07dd6599ee64f3063938efb4933","observation_id":"5bee170d-f6b2-4047-acff-1e972a7594c2","resolution":{"observed_at":"2026-08-07T15:42:56.679378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-03T05:27:32.394774Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-07T15:42:56.206898Z","title":"Tinyllava: A frame- work of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.206898Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:963c772a9df7bbd00cd98c8ce78d5c765f4e03d5c40ded9e25ee0624cf4a482d","observation_id":"04cc1c5d-e3fa-4e99-b933-ece44387040a","resolution":{"observed_at":"2026-08-07T15:42:56.206898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.478419Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":"39a9c86a-cfe4-40e9-98cc-9e652becf588","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.294364Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:271581a894454a00846425b00668581dd96847ad88a700eeecbd9f263979010c","observation_id":"10f9c9d9-75e0-4ad6-bb35-d5d11f6e01c2","resolution":{"observed_at":"2026-08-07T15:42:56.539136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:48:05.748430Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 4 inbound Pith citation observations for arXiv:2505.14260."}