{"as_of":"2026-08-18T21:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4749a6a814eec5f3f7bc2d322b099d5c5989c77272c307d905bb1c1644550427","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:35:24.414685Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:46:40.887036Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T00:02:17.832612Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-12T11:10:54.908074Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accel- erating large vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18499","last_updated":"2025-03-30T07:22:46Z","snapshot_observed_at":"2026-08-17T14:00:00.020812Z","submitted_at":"2024-11-27T16:39:04Z","title":"OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T11:10:54.908074Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2411.18499"},"observation_digest":"sha256:e3481f1661b40ea87c4904aac0211d0b73241bf1c7e8e216d09168aaed3bbba1","observation_id":"f9dca469-3ca7-4d88-a195-6e300ad78f29","resolution":{"observed_at":"2026-08-12T11:10:54.908074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-12T00:57:32.571714Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accelerating large vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-17T07:14:12.508584Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T00:57:32.571714Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2412.01818"},"observation_digest":"sha256:dc7db7fd2e3b1eaccb9e259fd23ff9b3f2a3f3f1e5f96acb7117b8cda174580b","observation_id":"dd486c63-78d5-459a-be7e-d5ee4d9da191","resolution":{"observed_at":"2026-08-12T00:57:32.571714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-11T12:50:08.595852Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accelerating large vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13817","last_updated":"2025-03-17T16:05:34Z","snapshot_observed_at":"2026-08-13T08:13:29.830302Z","submitted_at":"2024-12-18T13:04:30Z","title":"Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:50:08.595852Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2412.13817"},"observation_digest":"sha256:6ece17bcb71c41356a2a979e927b6b0f6c5aa96fb8575bbbd77a00fb8deb7431","observation_id":"a5b0afe7-b960-49c2-926c-4f6ae91eaa2c","resolution":{"observed_at":"2026-08-11T12:50:08.595852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":"2412.03324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accelerating large vlms","venue":null,"work_id":"2a87a76a-58aa-4a0e-bec4-17920088427c","year":null},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-08-17T11:28:00.095543Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:2cb0ce36f6be298290df3305ff2703dc310a0c528c81704dc489a51f18386b76","observation_id":"21413577-52f0-4762-ac3a-89d7f774f25d","resolution":{"observed_at":"2026-05-23T00:02:17.835408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-16T11:46:40.887036Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accelerating large vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.887036Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:e717997c427907feb44886fc692ab01df9237792565c556c53ad1741f2b405b4","observation_id":"d1e56ae1-92f8-45ce-a098-69b64aae0a9d","resolution":{"observed_at":"2026-08-16T11:46:40.887036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-06T18:03:03.547382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.547382Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e05c1e3cf0219e25c5554e0cc0cca60e696859f512c21ddd0bd01eda6541234a","observation_id":"bded14ac-604b-402d-8a64-1dfa3143d598","resolution":{"observed_at":"2026-08-06T18:03:03.547382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-05T14:52:56.639839Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accelerating large vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.639839Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:0697ce0de6b01eb9138129013a4494401724949f716c51a3357c6bb42b8c7140","observation_id":"40c8c8cd-cadc-47ae-af50-4b537eae3337","resolution":{"observed_at":"2026-08-05T14:52:56.639839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-04T08:44:42.492230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.19496","last_updated":"2026-05-31T09:39:34Z","snapshot_observed_at":"2026-08-12T10:37:52.743367Z","submitted_at":"2025-10-22T11:44:31Z","title":"CARES: Context-Aware Resolution Selector for VLMs","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T08:44:42.492230Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2510.19496"},"observation_digest":"sha256:e3e90e0fae30e714a742244bfdfb9b66115bb811a370ca2a4f152a355cbd6d24","observation_id":"69f62ef9-cb4b-4adc-950e-d49c7a52aed6","resolution":{"observed_at":"2026-08-04T08:44:42.492230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03324/citation-record","integrity":"/paper/2412.03324/integrity","json":"/paper/2412.03324/citation-record.json","paper":"/paper/2412.03324"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T22:35:24.131649Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.131649Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:9388a589032c7d89e7a0a990938b203d6b3269982993d6f75cd53cbb1fba1f66","observation_id":"b80bf627-b4f5-4c8f-92dd-4d45c5596364","resolution":{"observed_at":"2026-08-11T22:35:24.131649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-11T22:35:24.136453Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.136453Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:da7d9e4fffacd5e1f0001ef7e0ab832c47cad36ee8e698fdc60a020c9c3c9b75","observation_id":"dffbe916-ce9c-43fd-814d-26e8436859e9","resolution":{"observed_at":"2026-08-11T22:35:24.136453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T22:35:24.141236Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.141236Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:3f9e8c0f00d5b36bcffdadec4a473933a22575e3966457465d8562354af145e4","observation_id":"597db8eb-6cfd-4ddb-b0ea-a777332ef748","resolution":{"observed_at":"2026-08-11T22:35:24.141236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-11T22:35:24.145088Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.145088Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:44458b46ea5cccf2eb1fe785bc4752f121370753b81a3fb8451d46dee07a553c","observation_id":"8bfbba58-3684-481e-96d2-33a833a80c18","resolution":{"observed_at":"2026-08-11T22:35:24.145088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-16T14:10:58.157918Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T22:35:24.150592Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.150592Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:b6507bcf94393ed31029b4476819ebfcfb0acd935cbb5912f626c779b20d717a","observation_id":"7a680d99-9396-4a95-a4fa-dd313db57ba8","resolution":{"observed_at":"2026-08-11T22:35:24.150592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.594678Z","title":"Diffrate: Differentiable compression rate for efficient vision transformers","venue":null,"work_id":"48530d6a-1662-4cc6-8d0d-52875b374014","year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.155420Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:1cca8c6c3a5ed9b14bac39c8cddc4238505e70cd9e46e6479cdb394cddd7269b","observation_id":"cf64be47-647d-4e7a-b025-8120b4953f05","resolution":{"observed_at":"2026-08-11T22:35:25.598509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T22:35:24.159958Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.159958Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:f66d36a618d57a1824830aa9f336d83f5434d317a44fc078415b9084a989295b","observation_id":"87d881bb-902c-427c-ad94-3bd277521ab6","resolution":{"observed_at":"2026-08-11T22:35:24.159958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.582962Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"301dd2c9-2281-48ba-8281-174cf8a96aa8","year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.164533Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:a47533aa6cf47da13cc6ef7bf709c406970b977ef0863a22ceb12962781719b0","observation_id":"7bb2ad88-8998-40fc-80cb-a5cbe7647c19","resolution":{"observed_at":"2026-08-11T22:35:25.587132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.570686Z","title":"Gaussian yolov3: An accurate and fast object detector using localization uncertainty for autonomous driving","venue":null,"work_id":"637d4057-c280-4fbf-9eef-c8283fd82c28","year":2019},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.168457Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:7840138a53f9d2d3c294cb444d1598d31708ccd937ec51f04e04dabdf3a864ec","observation_id":"59c7c511-e49d-478d-b72d-f71617a54223","resolution":{"observed_at":"2026-08-11T22:35:25.575168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T22:35:24.172408Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.172408Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:ad84d15857fa0146d7c07b610ab771ec580fcf593567a0af8420c1b3fa911849","observation_id":"21089d75-128e-4dee-8e7e-65fe7f6a4461","resolution":{"observed_at":"2026-08-11T22:35:24.172408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10819","last_updated":"2020-02-25T12:30:21Z","snapshot_observed_at":"2026-08-17T00:35:24.021154Z","submitted_at":"2020-02-25T12:30:21Z","title":"Variational Inference and Bayesian CNNs for Uncertainty Estimation in Multi-Factorial Bone Age Prediction","version":1},"cited_work":{"arxiv_id":"2002.10819","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.10819","snapshot_observed_at":"2026-08-11T22:35:25.013313Z","title":"Variational Inference and Bayesian CNNs for Uncertainty Estimation in Multi-Factorial Bone Age Prediction","venue":"eess.IV","work_id":"5d95843e-183c-4d7d-914d-792a6f7bcd0c","year":2020},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.176457Z"},"links":{"cited_paper":"/paper/2002.10819","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:2f1276960e3cd3c6aed492988b6e9df24b85f688d891cb783671fdb3b41c2184","observation_id":"9a348b81-a753-410b-8de3-cc47f50e1c0e","resolution":{"observed_at":"2026-08-11T22:35:25.017858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07383","last_updated":"2023-11-13T15:08:59Z","snapshot_observed_at":"2026-08-16T14:43:46.035513Z","submitted_at":"2023-11-13T15:08:59Z","title":"LM-Polygraph: Uncertainty Estimation for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07383","snapshot_observed_at":"2026-08-11T22:35:24.180459Z","title":"Lm-polygraph: Uncertainty estimation for language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.180459Z"},"links":{"cited_paper":"/paper/2311.07383","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:50dd2c2ae4cabb810be2cc6df508dc3407a5221e935e2637403cf6f0d0a9c81f","observation_id":"9a0bda54-eb31-49e8-a12c-c55887089ee2","resolution":{"observed_at":"2026-08-11T22:35:24.180459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.559271Z","title":"Unsupervised quality estimation for neural machine translation","venue":null,"work_id":"b446470e-d9b1-4667-bf10-325d0d267515","year":2020},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.184754Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:f9f0da4578827ebc1a0e542dcc06cf61437e37c6a78e40269c5e8e996cc79787","observation_id":"26ae7411-ae43-4cc6-aad5-088bb7696a03","resolution":{"observed_at":"2026-08-11T22:35:25.563403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T22:35:24.188429Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.188429Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:c5faeb234974cde386b1e24cedd03541ecef1683fc5ac90b33e8b891d442ff93","observation_id":"162d0beb-03bf-4071-9ad6-6e14f8f408a9","resolution":{"observed_at":"2026-08-11T22:35:24.188429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.547016Z","title":"A survey of uncertainty in deep neural networks","venue":null,"work_id":"846836a5-a7ac-4c38-ab02-122166e14d47","year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.192530Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:d6539b9cb181e81e0fabac8abb9f06cb75637e3b6a1bb6361c8eb590c48237f9","observation_id":"f0ba39a9-4c5f-4249-9075-fa8b7cc898de","resolution":{"observed_at":"2026-08-11T22:35:25.551305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.533814Z","title":"A survey of confidence estima- tion and calibration in large language models","venue":null,"work_id":"f34e1133-e6e3-4a2c-8538-890f0ed01ff2","year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.196476Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:e53c4f8d2325a3474d10d44f343b3cf319d5f875a575b95baaba81bfa546d9f4","observation_id":"8fe0ac03-4f69-4af7-ba62-330c607f4be2","resolution":{"observed_at":"2026-08-11T22:35:25.538211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10136","last_updated":"2024-04-15T21:02:48Z","snapshot_observed_at":"2026-08-16T14:00:41.233757Z","submitted_at":"2024-04-15T21:02:48Z","title":"Language Model Cascades: Token-level uncertainty and beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10136","snapshot_observed_at":"2026-08-11T22:35:24.200147Z","title":"Language model cascades: Token-level uncertainty and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.200147Z"},"links":{"cited_paper":"/paper/2404.10136","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:528cc5251070dcdb1a31d619238a15e7de7c517d27bdd9f217b36536b7425f12","observation_id":"42afce4d-dc94-4a5b-945d-9aa562181af1","resolution":{"observed_at":"2026-08-11T22:35:24.200147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.520812Z","title":"Dynamic neural networks: A survey","venue":null,"work_id":"28ffacf9-a2f4-44e8-9fdc-22d37cad429b","year":2021},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.204411Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:7275b7779237545be59395163993d2a9b7cfe283d62ace66b600d2a679b3252a","observation_id":"22c5d3d7-51f2-4bda-a0fe-adffab19e0b3","resolution":{"observed_at":"2026-08-11T22:35:25.525821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.507983Z","title":"Learning to weight samples for dynamic early-exiting net- works","venue":null,"work_id":"c9c5c4a6-1972-445c-9021-32f9b254a629","year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.208236Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:2b9176aaee4204a5f62752b037e222417f0b566a501b52e6383c081034a5be2c","observation_id":"f530a7f7-9811-4456-a029-46dba21dbd53","resolution":{"observed_at":"2026-08-11T22:35:25.512291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.495193Z","title":"Dynamic perceiver for efficient visual recognition","venue":null,"work_id":"e3cefd8c-f8da-4cd1-9d94-fc843b986ece","year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.212183Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:8bdd3077c22694d76d9c8b381e3808675948a08df4dda08e79fcec3a2c6149eb","observation_id":"ae31749d-d47f-44f2-bf9f-42032d5546f8","resolution":{"observed_at":"2026-08-11T22:35:25.499337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.479269Z","title":"Latency-aware unified dynamic networks for efficient image recognition","venue":null,"work_id":"e93d5010-dab7-4fe0-af5b-b74c52528bd9","year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.216022Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:ccdc8695dc38cb9134d93034faedee77f3accb70c9de8222f7e7775663bf6c08","observation_id":"280d79c8-7b66-44b4-9532-ce7da5ca1a32","resolution":{"observed_at":"2026-08-11T22:35:25.486571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:24.224741Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.224741Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:f7f835e6c4622f81fb5b0d69ffdd8c33bac9de2465d73f66050433dffda6eb94","observation_id":"547c8ff2-a1fe-4320-9230-035534c038af","resolution":{"observed_at":"2026-08-11T22:35:24.224741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T22:35:24.228819Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.228819Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:9cb59648d362fabbbbced758a7928811a0faf363e90307a79941719673fb12d1","observation_id":"e5a79a57-2da3-41b8-84e2-d768c6fb0dd0","resolution":{"observed_at":"2026-08-11T22:35:24.228819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-11T22:35:24.232497Z","title":"Language models (mostly) know what they know","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.232497Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:6bd870a9606c57da66f4d5e12a0d66c2c2a09f5ef271d06bbde3a548e12fd8b9","observation_id":"ab0e875e-af33-4d1a-aa56-0b50ec8d0b3d","resolution":{"observed_at":"2026-08-11T22:35:24.232497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-11T22:35:24.236297Z","title":"Seman- tic uncertainty: Linguistic invariances for uncertainty es- timation in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.236297Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:f4fb06082fabe0170eab74980f90a7da4efd2871fc3a04a0a8f047225bc89ccd","observation_id":"c19f64a2-204a-4c4f-b76b-6669c9e6c06d","resolution":{"observed_at":"2026-08-11T22:35:24.236297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T22:35:24.239987Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.239987Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:5ee96966c645bfaff58908dc5feaf813b44e54570a5887a9614d0e2527fd530c","observation_id":"fabfd2d6-482e-4881-9f79-0f3000040416","resolution":{"observed_at":"2026-08-11T22:35:24.239987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T22:35:24.244102Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.244102Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:b524914c6b9c9625063cecc6da91e7923d6add671b6417b720d291f79f0c52a8","observation_id":"a729fb64-efa4-479d-8806-f2c3748c4c1f","resolution":{"observed_at":"2026-08-11T22:35:24.244102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.453143Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"47b41c1c-afb5-42ed-84a8-8f189f27cfe9","year":2025},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.248345Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:b9c4f113e194cd197ad2f21afe3f3c64710b4bedd9ddea35f8d182d3b2e6705a","observation_id":"f9ace29f-b2c3-4c1a-9975-52a0a6b3eaf0","resolution":{"observed_at":"2026-08-11T22:35:25.457111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-11T22:35:24.251928Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.251928Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:4ef2a3551aaa610023e44c2d23117b55469766dd38d5f284f4b7219d70078d79","observation_id":"37753420-09e9-4d16-b5a4-4b970e057cb1","resolution":{"observed_at":"2026-08-11T22:35:24.251928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T22:35:24.255857Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.255857Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:beaa146914f7de413fff347284d511c937e5de9623ce6bd5d5f9fbd008eda256","observation_id":"eacf2643-c1c8-431d-add7-0b837a19ad86","resolution":{"observed_at":"2026-08-11T22:35:24.255857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.426289Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"0425bc3d-b41e-486d-99ef-2211ca3a8cb9","year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.260042Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:1ffc8278f02925bbfbb2afe9ab794c54cad395a78cc4b2e987a499b984ef59bf","observation_id":"3c0c87d7-f737-454c-acb4-ab55915478e9","resolution":{"observed_at":"2026-08-11T22:35:25.444753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.414639Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"e224b510-1466-4468-9837-9b414f826160","year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.263882Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:5c08d566195e31a83964ad003e41dc2cf3f9e69a043924b644379415c53b3894","observation_id":"7bc46c4d-9efe-4d0d-84c4-536956c22cb7","resolution":{"observed_at":"2026-08-11T22:35:25.418833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.402509Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, pages 216–233","venue":null,"work_id":"c0a9991e-7eb8-49ff-8f5e-69620bc623e6","year":2025},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.267743Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:2827e6083c067e3e661f9e819826171f731994f59d5338b7c84ed2ab0e638958","observation_id":"ee878242-9dd9-4d55-ab3b-0d4c9dedd592","resolution":{"observed_at":"2026-08-11T22:35:25.407046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.388738Z","title":"A general framework for uncertainty estimation in deep learn- ing","venue":null,"work_id":"0fcad411-2017-46db-aa93-2473ded5ff9d","year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.271700Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:4bf2ad32dda7121fcbe62065f9502c5cacadfc66f2c4fc27e87c3cdd56702c38","observation_id":"3b44333d-2a1c-4329-9d71-99a573bfff67","resolution":{"observed_at":"2026-08-11T22:35:25.393865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20339","last_updated":"2024-05-30T17:59:47Z","snapshot_observed_at":"2026-08-17T22:05:42.917382Z","submitted_at":"2024-05-30T17:59:47Z","title":"Visual Perception by Large Language Model's Weights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20339","snapshot_observed_at":"2026-08-11T22:35:24.275563Z","title":"Visual percep- tion by large language model’s weights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.275563Z"},"links":{"cited_paper":"/paper/2405.20339","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:5aceb0c2dccf6a9b3c7bf3e965405af5b49bf400721edc1cfe6a0b65c55593d8","observation_id":"fb6c33aa-7d86-47d8-b5c7-34e380f5c08c","resolution":{"observed_at":"2026-08-11T22:35:24.275563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07650","last_updated":"2021-02-11T09:42:35Z","snapshot_observed_at":"2026-08-18T03:48:37.310852Z","submitted_at":"2020-02-18T15:40:13Z","title":"Uncertainty Estimation in Autoregressive Structured Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07650","snapshot_observed_at":"2026-08-11T22:35:24.279509Z","title":"Uncertainty estima- tion in autoregressive structured prediction","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.279509Z"},"links":{"cited_paper":"/paper/2002.07650","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:a5eebc9ecc824774e83bbd50e09137140d913e67eca9899706155b0aafee8f4c","observation_id":"9d0b0378-4832-4928-8740-31b2c9434eaa","resolution":{"observed_at":"2026-08-11T22:35:24.279509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.375089Z","title":"Generation and com- prehension of unambiguous object descriptions","venue":null,"work_id":"a7ae4b50-796f-4a8a-bbfe-8b11ae08132b","year":2016},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.283433Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:f2de3f209b5f6ca4d8421e00f00991d62ef4263ad045274195399d3ca908707b","observation_id":"256de611-863d-431a-a553-3b9a3ad11307","resolution":{"observed_at":"2026-08-11T22:35:25.379430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T22:35:24.287112Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.287112Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:449984d5440b8b0e7983bb99ad28d2fd63427ea999b22070339848b585ef8795","observation_id":"80bb03c8-50fa-4f9b-a971-e9f869ebe14a","resolution":{"observed_at":"2026-08-11T22:35:24.287112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.361816Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"71ca2682-73f3-4e1b-9ee0-b820da91aa26","year":2021},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.290804Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:3661eb93ce4586edb2f3306883202cdc33ed5ba3bff02383d90234e3e69b44cf","observation_id":"b65d3200-f144-4f79-ab5c-9f1837cedf35","resolution":{"observed_at":"2026-08-11T22:35:25.365988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.348741Z","title":"Adavit: Adaptive vision transformers for efficient image recognition","venue":null,"work_id":"3bb6882a-5479-4d8d-86a7-2e607eb8a345","year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.294063Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:2bfe31bd95349d6e1ded464ee931afec8771391bdde291335eb2ca1bf7b8df06","observation_id":"6daa8012-bc72-46fc-bb99-f3ad33ae1f73","resolution":{"observed_at":"2026-08-11T22:35:25.353525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10006","last_updated":"2018-08-31T21:59:35Z","snapshot_observed_at":"2026-08-14T18:35:26.897453Z","submitted_at":"2018-08-29T18:33:11Z","title":"Correcting Length Bias in Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10006","snapshot_observed_at":"2026-08-11T22:35:24.297510Z","title":"Correcting length bias in neural machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.297510Z"},"links":{"cited_paper":"/paper/1808.10006","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:1b901feb9325d098553ad4d4e7b3a3a84fdb54bc3bbce32f7532d6dde1afa0ec","observation_id":"750d9100-fad5-47cb-ad7d-a4d9a3e72df4","resolution":{"observed_at":"2026-08-11T22:35:24.297510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.337323Z","title":"Exploring uncertainty measures in deep networks for multiple sclerosis lesion detection and segmentation","venue":null,"work_id":"58d83d99-74c7-4a0b-b91b-47b70adf2282","year":2020},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.301667Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:d7678d5ea54439d824b9fead7fbd0837cf8ddbb2cbb220d97af91d64d9d9a05a","observation_id":"b315dadf-151e-41d1-b558-947a3f938775","resolution":{"observed_at":"2026-08-11T22:35:25.341116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.326965Z","title":"Hermes-2-theta-llama-3-70b","venue":null,"work_id":"88fbcd99-62ef-413a-9e27-1d3ff995ca3b","year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.305277Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:ba0396676c787b22d8dab854412d06d211d496bbc66290d76bd6446d64eed3f6","observation_id":"54226b09-ad0e-4586-91f6-30610c57c2c4","resolution":{"observed_at":"2026-08-11T22:35:25.330393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.316240Z","title":"Nous-hermes-2-yi-34b","venue":null,"work_id":"7c388468-5df9-43a0-9b72-ea61eb2d8645","year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.309019Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:0758fd79985808c60e7d671d8935f4de1319e4ca77b9d32f983c8382bd32f466","observation_id":"1f7da94c-1103-4914-828a-614fdb2de761","resolution":{"observed_at":"2026-08-11T22:35:25.319561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:24.313519Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.313519Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:8ded3e43c334224237c39140d783cde2ecfead23d9917d0fd7f0241ad3f2e7ec","observation_id":"eaa61918-7a26-4005-9505-0f7e8f136789","resolution":{"observed_at":"2026-08-11T22:35:24.313519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.297137Z","title":"Dynamicvit: Efficient vision trans- formers with dynamic token sparsification","venue":null,"work_id":"39127aed-58f4-4144-a71b-5c09e993c105","year":2021},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.319170Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:ea01f20372c68cedbf0aadf78e95aca1956b3195bd7c610c4ddd8095baedff4d","observation_id":"10c028e6-4ee5-485e-877b-a40dd3b1076b","resolution":{"observed_at":"2026-08-11T22:35:25.302495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.284193Z","title":"Out-of- distribution detection and selective generation for conditional language models","venue":null,"work_id":"d946eac2-b518-4648-92b2-1da0c2776c09","year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.323178Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:be1d63f6a10f13e8c8ad8bca8f91a0a0f2792426ec24223f77d904293d33e630","observation_id":"8048377b-bdad-479d-959c-b7b1e2d4f570","resolution":{"observed_at":"2026-08-11T22:35:25.288698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:24.326720Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.326720Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:abc4263b3ce93cead30da4802f3067e7ea306d6ef4747dea7d804959087b4aef","observation_id":"5cc36cde-1b41-442f-848e-46e7bdff52f8","resolution":{"observed_at":"2026-08-11T22:35:24.326720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12667","last_updated":"2024-04-24T16:38:32Z","snapshot_observed_at":"2026-08-18T00:07:45.058314Z","submitted_at":"2023-07-24T10:14:51Z","title":"TransFusion: Generating Long, High Fidelity Time Series using Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":"2307.12667","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.12667","snapshot_observed_at":"2026-08-11T22:35:24.705282Z","title":"TransFusion: Generating Long, High Fidelity Time Series using Diffusion Models with Transformers","venue":"cs.LG","work_id":"b755b6ff-fdbc-46ea-ad9c-4c9c7ae974bd","year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.330001Z"},"links":{"cited_paper":"/paper/2307.12667","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:2f00b70c30d946c81911e04b54610b4f12477d31c8e27d2574ba51c4d1450320","observation_id":"4eee219d-cf0a-4a03-a1a4-1cc5f006f489","resolution":{"observed_at":"2026-08-11T22:35:24.709346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.251638Z","title":"Towards vqa models that can read","venue":null,"work_id":"bcd8444b-41db-4a51-8d83-b08bbcac9bd3","year":2019},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.333889Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:96c0cd546bbe0e7d5f0ce8d5ed4350e3aba1c0303b03cb7da88a5bc53cded670","observation_id":"f1d2419a-4c06-42a1-ace2-857c86002f0c","resolution":{"observed_at":"2026-08-11T22:35:25.264339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-11T22:35:24.337472Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.337472Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:e4ab90c7a591aac3c731a4f7c7866f6c98299a3f2e05addc1204ffbdf16bff4a","observation_id":"a3f622d8-a03e-4e49-a129-718206b33d4e","resolution":{"observed_at":"2026-08-11T22:35:24.337472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:24.341013Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.341013Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:3e2b3b20ae376b5cd86df9fc7684042479ed88343352caf4ea43bd1456920c6b","observation_id":"f410656b-ceb0-47da-8a38-6305159b2b8e","resolution":{"observed_at":"2026-08-11T22:35:24.341013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T22:35:24.344055Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.344055Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:79cc55ccf041c8888378b063e882db649f1a226bb8a493ffa814475b64380b20","observation_id":"06c1507d-9f7e-4a92-99dc-209c79fc2735","resolution":{"observed_at":"2026-08-11T22:35:24.344055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T22:35:24.347240Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.347240Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:a5a46860b58a9b0ad376354785ee757ef6b7039a3772301c1eabd236d9c7516c","observation_id":"efbd56ec-f1a6-43eb-828f-672efa1fa9e8","resolution":{"observed_at":"2026-08-11T22:35:24.347240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T22:35:24.350738Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.350738Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:6ff4f0cffd58f9c607e21fac96f990fcf4e02e5723a6394082f887153a69a3ad","observation_id":"8de10cbe-8d0d-4f19-8629-9b34d56b30f4","resolution":{"observed_at":"2026-08-11T22:35:24.350738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-11T22:35:24.353965Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.353965Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:7d2ee6560cf28724e4f4bb535d82bf176c7a400888ac387f6a5a112359eea723","observation_id":"aa046629-c8b7-45d6-a284-e4906f8f7665","resolution":{"observed_at":"2026-08-11T22:35:24.353965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-11T22:35:24.357686Z","title":"Show-o: One single transformer to unify multimodal understanding and genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.357686Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:6a4268a79f45be8100ea3e2a62c267711a59830502fcbae6883b647edbff84d1","observation_id":"068bc7e2-f04b-44eb-8bbd-a7b133f09212","resolution":{"observed_at":"2026-08-11T22:35:24.357686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-16T13:32:02.889396Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-11T22:35:24.362275Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.362275Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:022334e74b9f1475f38cf3f690834339aab1604c1c49c1e64533065f4e1a4668","observation_id":"0a008773-a7cf-4d40-8821-176c5e918590","resolution":{"observed_at":"2026-08-11T22:35:24.362275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T22:35:24.366370Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.366370Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:f7fb81dbc89b30002ecd2a97adc7706458671e5f0d92f81cf045a090e438fb90","observation_id":"24e3a296-f2d8-4f6a-a149-160a987d8658","resolution":{"observed_at":"2026-08-11T22:35:24.366370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-16T13:41:59.452626Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-11T22:35:24.370458Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.370458Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:145f8fdb180e521c51fb11152ee406af9f97a791b021637ac4478ef2fada931a","observation_id":"94e33742-a456-418b-8ce9-4b18cac4efd5","resolution":{"observed_at":"2026-08-11T22:35:24.370458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01677","last_updated":"2022-03-03T12:32:59Z","snapshot_observed_at":"2026-08-16T17:17:14.674745Z","submitted_at":"2022-03-03T12:32:59Z","title":"Detection of Word Adversarial Examples in Text Classification: Benchmark and Baseline via Robust Density Estimation","version":1},"cited_work":{"arxiv_id":"2203.01677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.01677","snapshot_observed_at":"2026-08-11T22:35:24.537446Z","title":"Detection of Word Adversarial Examples in Text Classification: Benchmark and Baseline via Robust Density Estimation","venue":"cs.CL","work_id":"2d8652c5-3009-4189-ad7e-96e0225b522b","year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.375218Z"},"links":{"cited_paper":"/paper/2203.01677","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:b66c10a41ec1d08c72698bc4026d08eab331e7c92ceeb7abbbb2dc7f8acad6f8","observation_id":"0ee9a5c0-53d0-4abd-9d99-71082969652e","resolution":{"observed_at":"2026-08-11T22:35:24.543601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.230678Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"1cc94af8-8adf-4db9-9939-c844cf8ce090","year":2016},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.379188Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:f50d45625d3bd50db2e296bda418a4e284df51ecb14380fd3ae468dae2e0a4e6","observation_id":"412e5bb1-1918-49e7-83e3-a5b88d4495d0","resolution":{"observed_at":"2026-08-11T22:35:25.235115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T22:35:24.382882Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.382882Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:30f1961770370648a2a37446887342003f3cd0ee88db129a368d785f794d8b0e","observation_id":"136acb78-8d3d-47d9-8e9b-927cd930b3ba","resolution":{"observed_at":"2026-08-11T22:35:24.382882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03094","last_updated":"2024-02-08T22:02:22Z","snapshot_observed_at":"2026-08-16T14:55:00.404595Z","submitted_at":"2023-10-04T18:21:17Z","title":"Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03094","snapshot_observed_at":"2026-08-11T22:35:24.386895Z","title":"Large language model cascades with mixture of thoughts representations for cost-efficient reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.386895Z"},"links":{"cited_paper":"/paper/2310.03094","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:fc32ecb44bd2c66e041b35dd3c4d81805cc72b9eaa3832de9dbca4f91b30a2ce","observation_id":"67df8694-328f-484f-bca6-b88b44094052","resolution":{"observed_at":"2026-08-11T22:35:24.386895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.191755Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution","venue":null,"work_id":"f7cb5ad7-5c04-45a2-9df1-683d795f0794","year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.391458Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:adb2b83b0dc520679489ae20ae54f111a70a2c10f4dbb859a43709d969656d76","observation_id":"185df56a-4a07-48c2-9de0-536b5bd57a45","resolution":{"observed_at":"2026-08-11T22:35:25.205492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.127306Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"3eded017-bf51-4cc1-b74e-c74c70d1b71b","year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.395578Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:8935e2fa4d102d055991971a9cf5e1529b8e435b41596872546d527058ddc5c8","observation_id":"126c116e-66f3-4582-89ce-82949449cbe2","resolution":{"observed_at":"2026-08-11T22:35:25.131544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-11T22:35:24.399461Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.399461Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:e61cfc890afb6af0413ea3d61f949f05725997e138fc73868f16ace7d11cf83c","observation_id":"cf0e0db3-b9e4-457f-9d14-79a47e836c7a","resolution":{"observed_at":"2026-08-11T22:35:24.399461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:24.403563Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.403563Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:15a19a2ff7d9f6c211a73fb8023f7e96b90476817d3767b8265ab596cff08d73","observation_id":"af0d7fdc-e02d-4373-92f8-76bd17dcb453","resolution":{"observed_at":"2026-08-11T22:35:24.403563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03456","last_updated":"2024-10-09T01:01:34Z","snapshot_observed_at":"2026-08-16T13:12:34.433101Z","submitted_at":"2024-10-04T14:14:28Z","title":"Dynamic Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03456","snapshot_observed_at":"2026-08-11T22:35:24.407029Z","title":"Dynamic dif- fusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.407029Z"},"links":{"cited_paper":"/paper/2410.03456","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:3a7f6cf008c45aae9f89f52ec4ad552c18e4ec5c31efd0450606d1aed668609b","observation_id":"202604d5-e842-4a4a-a66c-965ad95557eb","resolution":{"observed_at":"2026-08-11T22:35:24.407029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:35:25.106278Z","title":"Dynamic tuning towards parameter and inference efficiency for vit adaptation","venue":null,"work_id":"ecaf9dc2-d141-416c-b6f0-ca6036add52d","year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.410825Z"},"links":{"citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:60d2fbfa7c486f90d6caed735498d184dc0b5a79150497f6044322820e3f1975","observation_id":"45205573-571c-4b89-b3e7-df6f90924a63","resolution":{"observed_at":"2026-08-11T22:35:25.111180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T22:35:24.414685Z","title":"small VLM memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.414685Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:57654d639f14538df0495e78a39ebb164f84d0a069a2f91458e863165a37c8cd","observation_id":"9476b23e-cb47-4439-82a8-3a88b722b234","resolution":{"observed_at":"2026-08-11T22:35:24.414685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 8 inbound Pith citation observations for arXiv:2412.03324."}