{"as_of":"2026-08-15T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fd89ecf38664a16f0f8e5877231bf09b0e4257435c03b833e9892ac94c2902b","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:37:08.457373Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:40:05.730181Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:16:15.637500Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"cited_work":{"arxiv_id":"2412.04317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04317","snapshot_observed_at":"2026-07-01T22:16:15.637500Z","title":"FlashSloth: Lightning multimodal large language models via embedded visual compression","venue":null,"work_id":"975da055-ceb8-4f94-b7cf-7622f3efaa01","year":null},"citing_paper":{"arxiv_id":"2606.02842","last_updated":"2026-06-01T20:06:50Z","snapshot_observed_at":"2026-08-02T06:55:51.435821Z","submitted_at":"2026-06-01T20:06:50Z","title":"Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:40:05.730181Z"},"links":{"cited_paper":"/paper/2412.04317","citing_paper":"/paper/2606.02842"},"observation_digest":"sha256:4fec1e6cecf10ab647252fb2627b39213ef513d7ad0a262054279408f307336d","observation_id":"a4d841cc-d0f7-44db-9149-201bb63d1284","resolution":{"observed_at":"2026-07-01T22:16:15.639326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04317/citation-record","integrity":"/paper/2412.04317/integrity","json":"/paper/2412.04317/citation-record.json","paper":"/paper/2412.04317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T21:37:08.227561Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.227561Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b0ea09e8503655f23b26481cb6a1c161d16d95fc1155ad1e1fe1e2ecad988466","observation_id":"b8a476c1-9b94-4994-8048-469c0fea17c3","resolution":{"observed_at":"2026-08-11T21:37:08.227561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.231500Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.231500Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:d018104e81923b2ba4eef6374cf1e61006ef1db9ef5c5f95e7da1266eb04f885","observation_id":"630a6798-b520-4f35-bebb-085cdcd1846f","resolution":{"observed_at":"2026-08-11T21:37:08.231500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T21:37:08.234380Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.234380Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:908a6ac75063850bc89c0f1044d28380958447287cb42cef9e603615eb8b985a","observation_id":"7153172c-ea37-4214-8c96-4f76675d4715","resolution":{"observed_at":"2026-08-11T21:37:08.234380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.237958Z","title":"Gemma: Introducing new state-of-the-art open models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.237958Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e160bcb41719f5d352c214d3b26780545c05f8b73d9c34856e084b5b42053b8a","observation_id":"1bbea82d-0bf0-4f1b-98f7-05fb89259d53","resolution":{"observed_at":"2026-08-11T21:37:08.237958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.240691Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.240691Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:eb2450c5be806630f6b7d9928b0ea470c5107f5f7b548d625a09408e601bcb3c","observation_id":"48487edc-c0c6-4e0c-9400-a6d7a23f3fca","resolution":{"observed_at":"2026-08-11T21:37:08.240691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.243430Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.243430Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5982e04579b974839039b8f6ca756d47b387931fef71ec9df2fed414b41a6a08","observation_id":"997d8738-1bd1-4fd5-9852-7e9055b7c5f3","resolution":{"observed_at":"2026-08-11T21:37:08.243430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-14T09:58:22.897108Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T21:37:08.246133Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.246133Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:09c59e77d31a89d9638280451e54f34bb4f68fe00c8a25c941d8b78fe5b494fa","observation_id":"c5ce3a98-1b80-4e69-8f83-431aa4261138","resolution":{"observed_at":"2026-08-11T21:37:08.246133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.249780Z","title":"Lawrence Zit- nick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.249780Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:8f4f93c447f8dfaa2bccae1e78fafccfef4604859b235c318fede740946ac1ea","observation_id":"a2f7a125-3085-4c86-8b39-27d816b7fb04","resolution":{"observed_at":"2026-08-11T21:37:08.249780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-15T00:34:34.553544Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-11T21:37:08.252944Z","title":"Pali: A jointly- scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.252944Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:1e455c6e231772a6ddf69618e20c84ee9150c89e183bae25cafb77c0a736dfea","observation_id":"25bd50ef-cdc9-4fcf-95db-4c4bdd09e788","resolution":{"observed_at":"2026-08-11T21:37:08.252944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.256084Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open- source suites, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.256084Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:4acb56eb735f778e66df9630f26e6bbb9f5c298c15654dff2317545eada9b3ea","observation_id":"4da9f6f9-2f64-4a7e-bc1e-72e72a807aee","resolution":{"observed_at":"2026-08-11T21:37:08.256084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-11T21:37:08.258655Z","title":"Mobilevlm: A fast, strong and open vi- sion language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.258655Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e746964f195a4fd602dac6958dabfc5a87158c006d27fe61147c23bd5f295916","observation_id":"5dffd154-db90-4c29-a3ad-c7e60474eb54","resolution":{"observed_at":"2026-08-11T21:37:08.258655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-11T21:37:08.261489Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.261489Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:a3c8cc461aada2c2ca4e00063c2d00e7f9a94ab4b85d4380b80a6f8248fd1bcb","observation_id":"2cfabdcd-b567-4d75-9956-05574f714485","resolution":{"observed_at":"2026-08-11T21:37:08.261489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.264453Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.264453Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:22c22dd6c5e45498eb261a67175aba03245a1fb548be01fcdc919c650cc3373d","observation_id":"9544fdc1-b620-420f-9a3f-199c7d42de2d","resolution":{"observed_at":"2026-08-11T21:37:08.264453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:09.004805Z","title":"Mme: A compre- 9 hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"e56a7c94-7f42-41d0-8a60-c20efc7c33b9","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.267203Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:634c789883e3107ac939fed925422abaccb42298eeef94b7f61b935da2540599","observation_id":"402e63c1-ce06-472d-b65b-62a8131ba07d","resolution":{"observed_at":"2026-08-11T21:37:09.007536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.997379Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"bfb8a9dd-e9f8-464f-aebf-d31b604dd399","year":2017},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.269857Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ba57645e2bb6b610e6cad0ccc960570886d70169e84b729f81246ad166389e56","observation_id":"2e3c46bf-2041-457c-a0a3-71607bc6ddfc","resolution":{"observed_at":"2026-08-11T21:37:09.000272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.990058Z","title":"Minicpm: Un- veiling the potential of small language models with scalable training strategies, 2024","venue":null,"work_id":"7eb361be-5f01-45b3-9663-a3d788765eed","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.272901Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:84f000b4908eb6c1d1a8764bc34376e57b7f68f6f8b07da08effa586b8a3da1b","observation_id":"527398e0-0bf9-48a6-a377-b88a7d565e53","resolution":{"observed_at":"2026-08-11T21:37:08.992917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T21:37:08.275372Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.275372Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:fb29a8388781fe63883f0e31c726a275bf9159319e57282f5c9361c8ad98db18","observation_id":"eab121c9-2d36-4c35-a170-f3587b65e6eb","resolution":{"observed_at":"2026-08-11T21:37:08.275372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.982204Z","title":"Token merging for training- free semantic binding in text-to-image synthesis, 2024","venue":null,"work_id":"0868355a-92c5-4301-a008-5493be2a1254","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.278335Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:1b5704a2e1591e60cd969e92088c8b6def0223e98158fbda26941150d245351b","observation_id":"6f0c000c-631d-492c-97a2-2c3ead4dec59","resolution":{"observed_at":"2026-08-11T21:37:08.985333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.974496Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"454de97e-8f00-416c-af6e-e9a4db2cbf75","year":2019},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.280814Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c9443f70ba9022bf6449a201f76bc91151edf197da3d8e22a2307f752a6fbfe8","observation_id":"dc1890a4-bb9d-4e1a-bc26-0cbe64f298a1","resolution":{"observed_at":"2026-08-11T21:37:08.977404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.966863Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"90add1d2-468a-45b6-b129-7bfc3acf60df","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.283336Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5c097ed448e811aa759da05bc0cdd27333e29a027fa8308bfc3b81f3c6953b8f","observation_id":"e149fc0b-b43f-464a-b106-f780aadeb0cb","resolution":{"observed_at":"2026-08-11T21:37:08.969681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.959480Z","title":"In defense of grid features for visual question answering","venue":null,"work_id":"65409f93-2574-4007-a1c4-d6ef5cd4d4d2","year":2020},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.285778Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:6e3e0e432bd83565574e293dced7c10948b2c7fea4d128b101a36e0b77917b3e","observation_id":"5200a819-4edd-424e-bdc8-2efbd06283bb","resolution":{"observed_at":"2026-08-11T21:37:08.962265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.952036Z","title":"Contrast and classify: Training robust vqa models","venue":null,"work_id":"e3cdefc6-6574-4401-a66d-3536be95a12b","year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.288247Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:fa5ebeb99b668fe14b63ded86611490ccea1bab9592994eb639a55a5426fc032","observation_id":"2f69eca5-7024-437d-b957-f3d20f9fb4be","resolution":{"observed_at":"2026-08-11T21:37:08.955006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.944545Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"105cc2e7-71f3-4d88-890f-5d03b05e068a","year":2014},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.290817Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f045af4a672b3a657b5061317799fc603539b1433e27b5c0b143186a4a7a4ae3","observation_id":"295cde2f-b1d4-433a-9d22-a4aa1aad5b48","resolution":{"observed_at":"2026-08-11T21:37:08.947365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.293615Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.293615Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5b008176bf53202ce307f4aab8153a3cc429c717fe71c04b93ef8a2fecefcf7e","observation_id":"14175937-1d25-4def-9bdb-51590fdf9c75","resolution":{"observed_at":"2026-08-11T21:37:08.293615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.933287Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":"959feec8-db03-45eb-b057-40664306b381","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.296242Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b868fdec7f3f64c06ca497552ec44aa9a7e851b1d12c5148cec399c60e1b0517","observation_id":"19186a00-6f9d-426d-a3ce-03d6c2c877e0","resolution":{"observed_at":"2026-08-11T21:37:08.936399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T21:37:08.299006Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.299006Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:68a2b0ae3ed927e29c6c083642e15ce248d491afeae0df19b916f7b58a1bf2e3","observation_id":"6fb39a02-0e10-4c36-befe-608ae9bd53d9","resolution":{"observed_at":"2026-08-11T21:37:08.299006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.301741Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.301741Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:baa49eaefb95cabb1c4fe06fd2ac7abaf4bf8807baaf9c5a4346b2ffb4ee345a","observation_id":"f294ee1a-9caf-4144-95ce-b22068d88a12","resolution":{"observed_at":"2026-08-11T21:37:08.301741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.922134Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"19f66c41-f1c4-4158-aa9e-69ee64808a73","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.304194Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:fcbf54fe7b21c9d322e4be55364ead6a7421e18f27f92b5b47c29e8b8907a05a","observation_id":"d3339ae5-77eb-42b9-97b5-e22a2112aad6","resolution":{"observed_at":"2026-08-11T21:37:08.924912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-11T21:37:08.306619Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.306619Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:a8093a441cd496d193152dae7056d9d124af633babf2115e941a7eeaecea675b","observation_id":"64483dff-5527-4c2b-ba48-8dfb8a2a7b10","resolution":{"observed_at":"2026-08-11T21:37:08.306619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.914485Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"4cb37dd5-069a-4168-b020-37f3c7d1e2e6","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.309221Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c21f35d893d6cbca242b9e89114a6156c12acfee76b22cbb9e5fbe703a0fd9ca","observation_id":"d0e2b9f2-4dee-4358-9153-54d800348272","resolution":{"observed_at":"2026-08-11T21:37:08.917574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T21:37:08.311714Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.311714Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5894bfcf12b464d8be9ebc1c39f6e43015594b25ae003e27a7dad18f1df0acc5","observation_id":"be65e829-2862-4674-a628-60aeec5efeb0","resolution":{"observed_at":"2026-08-11T21:37:08.311714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.906791Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"d215fa07-bed3-4240-ba88-a1548f253613","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.314473Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:73eb9ed0ecbae3b73afcad2ef89392bbd071c9c173ca394b1be73cbfbf2e0707","observation_id":"6ec3cd88-490d-46c8-b9b7-102a66d57b8f","resolution":{"observed_at":"2026-08-11T21:37:08.909721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.899462Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"f48771b2-b542-4edf-a5be-3a0b82cd19dd","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.317072Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:a46d86f9d7bfda3c51d2ae4c896f483ef00fe6cc6242e726d03f409a441d58a4","observation_id":"1a3aeb31-8b46-455b-aa92-cc18366b8b84","resolution":{"observed_at":"2026-08-11T21:37:08.902388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.891430Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"fe1d73fa-b897-4f6f-98dd-4858a255c2f4","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.319771Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e55fedf0da432d5e86e0a0fc05ed89ee44d3f01aea7fc39189b11d5afe4b5487","observation_id":"e5c29df2-6b30-4368-b898-6e8415d2ca4f","resolution":{"observed_at":"2026-08-11T21:37:08.894198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.882630Z","title":"Visual instruction tuning","venue":null,"work_id":"b87a0127-5334-45cf-b14a-915de3ecb317","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.322118Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f3db223a63a32bee02ad0f62c197c1682b2c4fe843a9a1d88f98a5821cc39d60","observation_id":"b77bb695-f88d-4844-aa9e-2d08401f8d9f","resolution":{"observed_at":"2026-08-11T21:37:08.885784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.874164Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":"9b8ac3b9-0778-4307-b3ac-8620bc9ea40c","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.324392Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:a48a56a4f17bcf900a0fc12eceb11a0d634f1f28530f2c20238e930c616eeb00","observation_id":"8e6abf79-d0d5-4d55-a27f-6f3591ac9396","resolution":{"observed_at":"2026-08-11T21:37:08.877386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T21:37:08.326784Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.326784Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c2513501cd26ec6fe54d6000354d1313dece9b999341a56965c54ccbb1acabba","observation_id":"4effb140-fbb8-4d2c-943c-6b91af32192d","resolution":{"observed_at":"2026-08-11T21:37:08.326784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T21:37:08.329705Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.329705Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:684f9e121077970c2e3b26fd99ff5aea32a8019fa5c05800bbf82bd36e03e423","observation_id":"26d39eb5-e572-43be-ad1b-f553186cd52e","resolution":{"observed_at":"2026-08-11T21:37:08.329705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.332592Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.332592Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:4a8980e6369fe36730375716dd5a10f50121678be1749881374830cedf907ba5","observation_id":"ab43a5b8-737a-4264-a66a-835219ebd03b","resolution":{"observed_at":"2026-08-11T21:37:08.332592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T21:37:08.335366Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.335366Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:98f6f328a54ce15e293cf49c527bce5d0dd0b851303ad05c66f941e76e0da326","observation_id":"72c5abab-e79f-4606-9c23-25d0eb12da07","resolution":{"observed_at":"2026-08-11T21:37:08.335366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.862182Z","title":"To- wards lightweight transformer via group-wise transforma- tion for vision-and-language tasks","venue":null,"work_id":"eeca2cd1-046c-4a3e-861c-bc9aac4b1e1f","year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.338155Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f2cbe0ea446b5db8981e8208fe0aee5b5171da292e9ae699d496d9512288aff1","observation_id":"7327ee58-e4d1-4ef8-ac14-950aa62dff77","resolution":{"observed_at":"2026-08-11T21:37:08.865032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.854454Z","title":"Cheap and quick: Efficient vision- language instruction tuning for large language models","venue":null,"work_id":"0d11b4e5-ccf9-44a4-a8e5-a22ca83b0254","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.341165Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5b7b6348699c79d6dbf2f7ec121781375b87a73ef0c625d2aa23483cb850fed2","observation_id":"f496d380-de84-48cd-9559-242a5d46327a","resolution":{"observed_at":"2026-08-11T21:37:08.857341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.343738Z","title":"Moil: Momentum imita- tion learning for efficient vision-language adaptation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.343738Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:06d3c907c37736b3934eb470cd4b74b558acdc5dc59c432eb5bc2382f3c5444f","observation_id":"f99125b1-42d1-4b03-b293-14644c5b97a5","resolution":{"observed_at":"2026-08-11T21:37:08.343738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.843071Z","title":"Towards language-guided visual recog- nition via dynamic convolutions","venue":null,"work_id":"48f1706f-f32c-42d6-a4af-0f26c6384d2b","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.346149Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:0e3cddc79a8b081ec1d1fca176a6d7a6416ba8c81417a136e9582079c856ea86","observation_id":"c9fbdc75-f9fc-4890-b09e-5eb04d28568a","resolution":{"observed_at":"2026-08-11T21:37:08.845990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-15T01:58:37.525169Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T21:37:08.348453Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.348453Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:d9fedc7127bbd9662be609acadd1ebafa8c61b65ab80f1b743ecf6f3b8f8de79","observation_id":"a0e638c8-4f5a-4ed1-ba4a-15faa67b0baf","resolution":{"observed_at":"2026-08-11T21:37:08.348453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.834873Z","title":"Chartqa: A benchmark for question answer- ing about charts with visual and logical reasoning, 2022","venue":null,"work_id":"39e62f3e-e28b-4c25-b82c-970567c3d5cc","year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.351277Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:df8aa41e07432cea1429d7177c7290b82540ef4c809fdbd80a7681a8ed8f5120","observation_id":"8e27a5ca-7e74-46f2-ae78-61ad377c1b7f","resolution":{"observed_at":"2026-08-11T21:37:08.838006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.826803Z","title":null,"venue":null,"work_id":"05dae5c9-3595-49b9-8b41-f68bfb4d628c","year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.353618Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:344441e4ad75accc677342002b91c6c5e085e7b8bd7c087dfbef1dcd7d1e41fa","observation_id":"b94b76ec-e7bd-4786-92b9-4028b6f44007","resolution":{"observed_at":"2026-08-11T21:37:08.829927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T21:37:08.356012Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.356012Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ec48f8239ed6f02e2f45be0ed064b562f25d28d9b6ef2ea3feeb062941bb77d8","observation_id":"0cc2e6e6-aab0-40db-b992-db6c012216f2","resolution":{"observed_at":"2026-08-11T21:37:08.356012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.358592Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.358592Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ebd53b9983e411097b55a10d890dd5deb08e4f7912413a74a8fd7d329487944b","observation_id":"208567de-d3f6-45da-9e74-a99002bd76a9","resolution":{"observed_at":"2026-08-11T21:37:08.358592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.361676Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.361676Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:6e3b8c73a9d9cf713412ecb5ad0cb5459cc686db90ac453cda81007d65e48d5f","observation_id":"f54f0555-8992-441c-8355-7a9e7a0297b2","resolution":{"observed_at":"2026-08-11T21:37:08.361676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12107","last_updated":"2024-05-30T02:47:10Z","snapshot_observed_at":"2026-08-13T00:03:43.230029Z","submitted_at":"2024-05-20T15:23:19Z","title":"Imp: Highly Capable Large Multimodal Models for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12107","snapshot_observed_at":"2026-08-11T21:37:08.364232Z","title":"Imp: Highly capable large multimodal models for mobile devices","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.364232Z"},"links":{"cited_paper":"/paper/2405.12107","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:6e481e261509459d4d1d6fdd3c4b5539e0736f226e835d90a9dc954b85944ac6","observation_id":"f09e7d82-b271-4736-aea6-4599f8fcc571","resolution":{"observed_at":"2026-08-11T21:37:08.364232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.810170Z","title":"When do we not need larger vision models?, 2024","venue":null,"work_id":"f48f7646-d22c-4d36-80ab-8b502536e91b","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.367027Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:20c6d3fdffced6c384b1c763866f125dbbbc074e1105891c2ba6b7cd07b09e12","observation_id":"873ba2fe-e190-4711-860f-6bf6827ed107","resolution":{"observed_at":"2026-08-11T21:37:08.812922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-11T21:37:08.369438Z","title":"Eagle: Ex- ploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.369438Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:1c700a837df2f5fd4243bad76678b5b2c9ad98653d473e3c29c467a710552c1a","observation_id":"16054fb2-0a0c-4f1b-8662-43a7cd5815a4","resolution":{"observed_at":"2026-08-11T21:37:08.369438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.802678Z","title":"Towards vqa models that can read","venue":null,"work_id":"880f86ae-296b-4e40-a9ef-b7f387a70880","year":2019},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.372029Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f2f917c1eb2f4e39366af51feae7fc0affafb9b440c6b6cc2a6036eba0c6e60d","observation_id":"60bbf9ad-f9a3-4482-b029-b3826a42ba27","resolution":{"observed_at":"2026-08-11T21:37:08.805615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T21:37:08.374548Z","title":"Gemma: Open models based on gemini research and tech- nology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.374548Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:41ec3453b6e4017ff059ac48f6e27fc4dbf5065703cea34cbba4faf6dca95765","observation_id":"32e1e7cc-c75c-48c7-bf92-4d50e1954a75","resolution":{"observed_at":"2026-08-11T21:37:08.374548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T21:37:08.377247Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.377247Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:6ac9ac39f980552b859a373b2b1bb160b789f9bd9bae6c9072d9a18dc6e3c286","observation_id":"92d80c96-c396-4a7f-8abc-a8b4742a2691","resolution":{"observed_at":"2026-08-11T21:37:08.377247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08962","last_updated":"2019-09-25T22:55:20Z","snapshot_observed_at":"2026-08-14T21:38:13.014467Z","submitted_at":"2019-08-23T18:02:05Z","title":"Well-Read Students Learn Better: On the Importance of Pre-training Compact Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08962","snapshot_observed_at":"2026-08-11T21:37:08.379783Z","title":"Well-read students learn better: On the im- portance of pre-training compact models","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.379783Z"},"links":{"cited_paper":"/paper/1908.08962","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:2c1f22c1d3bff957bc0c114dbe0027be909877d732a1ac7f23d255dec3438aa2","observation_id":"ef2dddbc-3ab3-413d-bbb2-889b9be9d0df","resolution":{"observed_at":"2026-08-11T21:37:08.379783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T21:37:08.382822Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.382822Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:dfa32485505ce8d32e0d7e5a3df5e09d283303e6af24c2e650458748c49e08ec","observation_id":"a4b708de-7375-4531-97d7-9e73da4f9c3e","resolution":{"observed_at":"2026-08-11T21:37:08.382822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03044","last_updated":"2016-04-19T16:43:09Z","snapshot_observed_at":"2026-08-14T23:00:34.588086Z","submitted_at":"2015-02-10T19:18:29Z","title":"Show, Attend and Tell: Neural Image Caption Generation with Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03044","snapshot_observed_at":"2026-08-11T21:37:08.385543Z","title":"Show, attend and tell: Neural image cap- tion generation with visual attention","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.385543Z"},"links":{"cited_paper":"/paper/1502.03044","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:1e3349ea7bdd40fa57d2ad60b45014908b4609c1b2ace18d80c6b564a137a790","observation_id":"f271e797-ccf5-484f-8716-5a434963d2a9","resolution":{"observed_at":"2026-08-11T21:37:08.385543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.795078Z","title":"Stacked attention networks for image question answering","venue":null,"work_id":"69e51151-6942-4cd6-96bd-df0027e86144","year":2016},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.388241Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:4f1db3beeb2cdc2c1a1b893a0c543c687337af8ee2a850ffbec6dea5f6117d09","observation_id":"df808884-647b-4e16-bd72-646e0931afae","resolution":{"observed_at":"2026-08-11T21:37:08.798043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.787497Z","title":"mplug-owl: Modularization empowers large language mod- els with multimodality, 2024","venue":null,"work_id":"00957da1-5f2a-4401-a1fd-c57fa00f9b08","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.390580Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e9f90a951f73f3671093eb3e2e7fc26ac9db185c38cb98b83456eab11261a1f9","observation_id":"2bf59c01-1ee7-41e3-ad7f-a02e7a9590f1","resolution":{"observed_at":"2026-08-11T21:37:08.790234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10197","last_updated":"2024-12-25T04:30:16Z","snapshot_observed_at":"2026-08-12T22:44:09.298226Z","submitted_at":"2024-09-16T11:43:19Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10197","snapshot_observed_at":"2026-08-11T21:37:08.393098Z","title":"Fit and prune: Fast and training-free visual token pruning 11 for multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.393098Z"},"links":{"cited_paper":"/paper/2409.10197","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:56295bacacb8dd9b7c4dba730b40363cb78902e485c3b7e55db5ab66bed789ad","observation_id":"55a8b314-8652-4f49-8c5e-a1fc978e722e","resolution":{"observed_at":"2026-08-11T21:37:08.393098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.779603Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities, 2023","venue":null,"work_id":"26392e18-1c9f-40d6-b95c-d7dce329e140","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.395868Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:12ccb5925f7826e359c58ec2d76c3983b6bb5be995fb9f07324daac2642a4712","observation_id":"92f936f9-cd1b-4c9a-9078-69b019d9c7ef","resolution":{"observed_at":"2026-08-11T21:37:08.782501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.772370Z","title":"Deep modular co-attention networks for visual question an- swering","venue":null,"work_id":"961b4108-c012-43bf-aa59-d38e6018b934","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.398429Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ec8826d5f7d4d10b4f26ad0425e32026b97539c5e9468d8779b92f73910b426e","observation_id":"a8ab1367-712e-4e3e-ab80-7da9fa0e8e85","resolution":{"observed_at":"2026-08-11T21:37:08.775215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.764703Z","title":"Tinygpt-v: Efficient multimodal large lan- guage model via small backbones, 2024","venue":null,"work_id":"7b13ae68-67af-425d-a933-72ed0f51e2a8","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.401027Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:7d0ef4bc9046251413fecfef932e95841bb7510f03866fcc8e2f8a32064aca68","observation_id":"f72e0beb-c44f-48c2-96de-368aa8556536","resolution":{"observed_at":"2026-08-11T21:37:08.767930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.757120Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":"9674b5d1-5eaf-4317-8108-16b84ad31339","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.403823Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5d81c5a8dea85b386acab909567a262395e03eccdfc92e32ac829225e9b76be7","observation_id":"caa8085a-2a3c-4a56-a9cc-ff0e030ee692","resolution":{"observed_at":"2026-08-11T21:37:08.760040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.407076Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.407076Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:2109b2953d1959883a7a9d28ddf4ce02c8eafb3af7293b8c56aa4b3934f592fa","observation_id":"b2f69a39-5f6d-4fe1-94ea-6661d0005158","resolution":{"observed_at":"2026-08-11T21:37:08.407076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-15T11:50:56.002712Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-11T21:37:08.409547Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.409547Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e7cf12bffb2160ed78a0ca22847fda4e870d687cbad2556e5eb5ffc48ac3fbe4","observation_id":"acf37657-d8f1-4fec-a07d-c07e8a932943","resolution":{"observed_at":"2026-08-11T21:37:08.409547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.412907Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.412907Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:1e9fb9534ab4911624a60aa8516d29868fcc68714de1eac07e5e171eb521004e","observation_id":"b0f53947-2e19-437d-93ad-4e44cb06403e","resolution":{"observed_at":"2026-08-11T21:37:08.412907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.415267Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.415267Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:3b91aa1edf9e4fd17733d90886ac8d168b5ff6220229e5c6e7b807a13e043ac7","observation_id":"5c07de0f-ffba-412b-b950-8ba9bbd313f2","resolution":{"observed_at":"2026-08-11T21:37:08.415267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T21:37:08.417720Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.417720Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:2813839016aac9fae2c8880995111c5c9046538cb39f35a24183fc6e7fb157bb","observation_id":"4536e021-a980-4ee2-8a99-b48b30bccffe","resolution":{"observed_at":"2026-08-11T21:37:08.417720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.737497Z","title":"Free vqa models from knowledge iner- tia by pairwise inconformity learning","venue":null,"work_id":"78026874-1fd8-4a44-9073-3e3fb8acac55","year":2019},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.420493Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:96c6e53b05fbb92072dec4efe1730369c6a35df67a00753bd795f145fd2c3b5f","observation_id":"4dd6a1d4-33c7-4ec0-94cd-52a422597aae","resolution":{"observed_at":"2026-08-11T21:37:08.740215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.730123Z","title":"Trar: Routing the attention spans in transformer for visual question answering","venue":null,"work_id":"81b4230c-76f1-4c0d-a5ba-94d5b4e4f367","year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.422900Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:8e53fa1cbc9ed18ce9f5af0001befdea0a09ee40c43f77dda739a6951b77e1cf","observation_id":"39a79b3a-3f8d-4519-9f6c-dfb5d8b3ebd6","resolution":{"observed_at":"2026-08-11T21:37:08.732876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.722419Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":"ea5e0371-0da7-41fa-87f0-beec8d295715","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.425431Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:35ab84c8933d7b0fdb1e714f32e862386e6bc4886953f01698a18e071f6372ba","observation_id":"863d176b-39ce-4965-b82c-bc35082c741d","resolution":{"observed_at":"2026-08-11T21:37:08.725697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06199","last_updated":"2024-03-25T05:36:56Z","snapshot_observed_at":"2026-08-13T00:58:12.511635Z","submitted_at":"2024-03-10T12:43:27Z","title":"Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06199","snapshot_observed_at":"2026-08-11T21:37:08.427822Z","title":"airport\": xxx,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.427822Z"},"links":{"cited_paper":"/paper/2403.06199","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:21e8815352dfe9166e7799a382fd6f157bc63ef04a2e1bfbdc19f1b785021531","observation_id":"6d31a72e-f5cf-467c-bda0-e859e0ea21ac","resolution":{"observed_at":"2026-08-11T21:37:08.427822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.715309Z","title":null,"venue":null,"work_id":"a1c52de5-aa02-4af7-ae66-e8e5b0109b26","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.430767Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:611043a5a3b7028b2eecff05af667fd246bed83e553e86ef1456565b07e3c249","observation_id":"7a1cb42e-0145-42bc-93d2-d71b52a7757a","resolution":{"observed_at":"2026-08-11T21:37:08.718218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.708276Z","title":null,"venue":null,"work_id":"6c97c50c-236e-4ec6-b2ea-35337fd9577b","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.433171Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c58aff4a2525a4f104d49e8ccb78b4ecb5b99d514cdc3ca54d05e07513c62f6b","observation_id":"044164c0-8c90-40f7-8768-cc4f0c7ebb24","resolution":{"observed_at":"2026-08-11T21:37:08.711080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.700103Z","title":null,"venue":null,"work_id":"37d18042-14c7-4777-92dc-a2efa4429bf7","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.435461Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:9be98e6f6a351e4b5b4ee4be794cbb56f443bf9777f190ba5151bf24d1f1f262","observation_id":"9803d311-a481-4c98-9916-a256a7ef60a0","resolution":{"observed_at":"2026-08-11T21:37:08.702909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.692338Z","title":null,"venue":null,"work_id":"4bded7f4-148f-436a-8556-ff6c131f23e7","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.437867Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:dfc28599b0e7e1a0377c777bf315d3c535293be7b008dc1f214f5e4e5ba550ec","observation_id":"b8c945af-388a-4435-8980-7a542ac4e4a4","resolution":{"observed_at":"2026-08-11T21:37:08.695244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.683557Z","title":null,"venue":null,"work_id":"03776b10-7bae-4674-a17a-7f8c262a7650","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.440180Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:0046a0a83d84e53232f714aa34806e2bc341550e35cfd62ec2338592e2df2170","observation_id":"e7484725-fc2b-4fdf-8647-f81f95fc8b3c","resolution":{"observed_at":"2026-08-11T21:37:08.686740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.675801Z","title":"Therefore, the value of the square in the figure is 2","venue":null,"work_id":"768f91de-6bd7-4db1-8970-5f5ca12c4b7c","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.442544Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b0023e5ac57380cce19ee724406a1c5fe11ac723503521bc58f549e49de823d9","observation_id":"5d5ce4cc-e1d8-4f57-97bb-d4ec7709e76a","resolution":{"observed_at":"2026-08-11T21:37:08.679023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.668269Z","title":"control center","venue":null,"work_id":"cfda3fc1-f1b7-4ace-a54e-5c5171b350cc","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.445034Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c1753143ba43da4a5cd21e3c4281dd05882034fd65cece37ec97ae71077bdc87","observation_id":"823a836a-6e37-43b4-bf38-f2db8912ba61","resolution":{"observed_at":"2026-08-11T21:37:08.670988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.653287Z","title":null,"venue":null,"work_id":"c462f014-8f2e-4e4b-b376-fc6d0a9c6ed3","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.450057Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:1b3c9aca5d9d60a51b4bc22126d65fdd070b0e4d038e31b74d68b824adbef9f0","observation_id":"3ab4ddba-1331-4c01-9e1b-b3940d8881e0","resolution":{"observed_at":"2026-08-11T21:37:08.655902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.646009Z","title":null,"venue":null,"work_id":"74cc123e-4da0-4a0c-945a-b245569e9049","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.452450Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:7ba00ef59782dcec356b2f6b4a7adb5c34879e14e218ff83b186eef1ccbe0ca2","observation_id":"ad67f5a0-d0b2-4b9b-95da-b78400b582a0","resolution":{"observed_at":"2026-08-11T21:37:08.648609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.638737Z","title":null,"venue":null,"work_id":"5c790530-cac8-4dee-a18b-642bc4e59ecd","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.454943Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f21293bfc212322f079ebb47ea78298aa6a5653f309dcd25667a937687167c03","observation_id":"275209cb-2bf7-4178-aac4-6d48a670f5a5","resolution":{"observed_at":"2026-08-11T21:37:08.641489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.630079Z","title":"RIGHT\",","venue":null,"work_id":"d7bf3f44-68a3-40c6-a89e-bd144db0362a","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.457373Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e70a6589a52c5e42ee153233be6fce2aa1c9af6d5444aea5a9db12d1c9ab5355","observation_id":"9c492150-ab38-4202-8025-e9e1cf4e7473","resolution":{"observed_at":"2026-08-11T21:37:08.633594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.660534Z","title":"Decreased","venue":null,"work_id":"155a9e21-59fc-432e-987b-75bc7392f232","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.447590Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:6d080b32e78b133864b6b0d3e8028da92f70a49100d7228c2524cfeb27c743fb","observation_id":"6c5fd70e-35c4-484c-aaea-fffc2a260bd9","resolution":{"observed_at":"2026-08-11T21:37:08.663257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:22:00.376134Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 1 inbound Pith citation observation for arXiv:2412.04317."}