{"as_of":"2026-08-14T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b496a6de8f77e95d408e6ed7464d68f3ad316f66cd6e45075b2e30820315496","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:25:00.399099Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T22:40:39.892802Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T22:40:43.026280Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"cited_work":{"arxiv_id":"2411.17773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17773","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hudson, D","venue":null,"work_id":"ac2b1892-9d94-4fc7-a2ae-7528e2e97690","year":null},"citing_paper":{"arxiv_id":"2508.06038","last_updated":"2026-05-18T14:51:17Z","snapshot_observed_at":"2026-08-02T14:57:47.919020Z","submitted_at":"2025-08-08T05:49:42Z","title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T22:40:39.892802Z"},"links":{"cited_paper":"/paper/2411.17773","citing_paper":"/paper/2508.06038"},"observation_digest":"sha256:c9142c899567bebf90097514ae6b56b7000a886805519ab23579e987e31436b0","observation_id":"87aad0bf-2f97-415f-9013-4e57a68f7c86","resolution":{"observed_at":"2026-05-21T22:40:43.028908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17773/citation-record","integrity":"/paper/2411.17773/integrity","json":"/paper/2411.17773/citation-record.json","paper":"/paper/2411.17773"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T12:25:00.306947Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.306947Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:817989001c91167221e400254d75f113a0ec33823ccf53bd2b794feedd6e7bfc","observation_id":"5230cde1-3152-4f7c-b770-1f9f6c3b7551","resolution":{"observed_at":"2026-08-12T12:25:00.306947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T12:25:00.310224Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.310224Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:6ad1e64b2fea41b58b64e9ebbf7cf23b1b0e03a61786ac07cd94d56144b4c2b8","observation_id":"ef091b08-659e-444b-a3ad-8becc7b819e9","resolution":{"observed_at":"2026-08-12T12:25:00.310224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.313096Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.313096Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:4abae768755d3a9d3daa2db364651e3681dedc6734e9efd2d8e281f6d9f4802d","observation_id":"f2e6de39-00dc-4dfb-8d64-9cea8fe19938","resolution":{"observed_at":"2026-08-12T12:25:00.313096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-12T12:25:00.315976Z","title":"To- ken merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.315976Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:fe5588d232c9050cd88aaf438cebf45593fc190e3e049b12b6d941b57c0f4265","observation_id":"afd818f9-a137-4b25-88c2-cf1002a6f4b2","resolution":{"observed_at":"2026-08-12T12:25:00.315976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.318802Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.318802Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:86f699ab9fd507b3048d2c106b315fd68bb3d3f474cd9671ae1afe78d62ac898","observation_id":"64644470-221f-407f-89bd-3744c2d2c8ee","resolution":{"observed_at":"2026-08-12T12:25:00.318802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-14T03:26:31.108831Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-12T12:25:00.321557Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.321557Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:8a106182e405c17b5795e3bd33dee9e1bcd0cbb1822af5ba03503236ee927c06","observation_id":"cd12837a-9450-408b-9fd3-ad712256895b","resolution":{"observed_at":"2026-08-12T12:25:00.321557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-14T09:58:22.897108Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-12T12:25:00.324543Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.324543Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:070ad473537ea63a25fb9c5ce4dde8e0c236285e6705830e91275406528a2134","observation_id":"d47b8885-67fb-41c9-b767-57ae6ed2ef53","resolution":{"observed_at":"2026-08-12T12:25:00.324543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.327432Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.327432Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:9cedf4474ed78582eb08a009634b13c68a274f9577fb3d513192a1c92046893e","observation_id":"4b1a71e4-03c2-48aa-9ae9-0176bd548584","resolution":{"observed_at":"2026-08-12T12:25:00.327432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.589145Z","title":null,"venue":null,"work_id":"c3edc67c-6dd1-4b30-89e5-2b65add5cc00","year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.330264Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:e30ef10a883f6cc33dea601030bae84b6c938d941d76317b2191ebf0aae72f2d","observation_id":"09893b2c-e01d-47ac-9d3c-3cc20284bdd4","resolution":{"observed_at":"2026-08-12T12:25:00.591947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T12:25:00.332531Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.332531Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:784ee70b3b184eefe2bac4a3db8b4ab4a3998ae90ed8d0c9b8eee74433e80858","observation_id":"214b2d25-4901-43fd-bf37-467ef56475b7","resolution":{"observed_at":"2026-08-12T12:25:00.332531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-13T20:00:04.634953Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-12T12:25:00.335430Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.335430Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:8ab302ac08c65c4f8847bb193241c11599642eadbea7e8bb33933dff3757aeec","observation_id":"9a977841-9611-4c50-928e-2d65fd479c4a","resolution":{"observed_at":"2026-08-12T12:25:00.335430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.338172Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.338172Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:fc7b1c3478b869d78962edbc77c593d54eeb778d89d93c77475c0cb648b1492a","observation_id":"45b90320-8df4-49bd-b9f6-45ecfd133974","resolution":{"observed_at":"2026-08-12T12:25:00.338172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.340410Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.340410Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:9cfb7141ff0e4d1e5b30043efb825706de4164cf02a8191f17a86445966dca42","observation_id":"f60001f2-cd20-4437-804b-4f2d2c99ec73","resolution":{"observed_at":"2026-08-12T12:25:00.340410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T12:25:00.342758Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.342758Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:acd520636d160cfb466f0904c88331c72c421085f21dad75a357e735a0fadd0e","observation_id":"1b4b2d2c-4d3e-4d45-874d-7c293341aebc","resolution":{"observed_at":"2026-08-12T12:25:00.342758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-12T12:25:00.345323Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.345323Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:c736e9ccd0762368de16597aedbd827031d35c6e23f8aecb912b8ce148e5553f","observation_id":"0358a844-7806-4255-9a7c-cc027c1d2bf3","resolution":{"observed_at":"2026-08-12T12:25:00.345323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-12T12:25:00.348083Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.348083Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:3331d2db36a5ff75bf3fed7d025e90a92ce5cd21bc77a9afbb1f5522fe7c887e","observation_id":"0442edb4-31e6-4af3-84aa-3c588239285b","resolution":{"observed_at":"2026-08-12T12:25:00.348083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.574429Z","title":"Visual instruction tuning","venue":null,"work_id":"85b8ed56-391f-4597-8a03-04f332dd9e6d","year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.350609Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:4e71ef9daa9479787fb42ed8c6d77d654857e2915b7cdcc38d628a8182a269d7","observation_id":"3c04a221-ead8-4f7c-9d06-9c06c01835e9","resolution":{"observed_at":"2026-08-12T12:25:00.577189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T12:25:00.352950Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.352950Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:0a93a19ce8902b4a6dd668b0f9eacb0fd26ba96b2cb03a1adda5bf81d52f82dc","observation_id":"c3ade4e1-85ea-4eab-89ca-8399625fe3f9","resolution":{"observed_at":"2026-08-12T12:25:00.352950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.355823Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.355823Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:286ab0a5ff9eb86caf443df458efb2763631105c6bb632448047971957e590e5","observation_id":"57c8ee26-7b4e-4e2b-a9b3-98e9b32fed22","resolution":{"observed_at":"2026-08-12T12:25:00.355823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.358347Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.358347Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:351ae43497861dd25cfaf728a85730f41889f5f15f1be9c0a3d7b0af9d800ded","observation_id":"405752d7-7327-4b50-a1a7-d897cf44dcd3","resolution":{"observed_at":"2026-08-12T12:25:00.358347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.360675Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.360675Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:08992ea539b4065bb2bad246c66f69f9e1e6f58373c25a7c72fb27868f17dab6","observation_id":"5a07fea6-86ee-449d-ae0e-ece8976773c9","resolution":{"observed_at":"2026-08-12T12:25:00.360675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T12:25:00.363060Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.363060Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:17f40b2e53c6f29fd44e2cb95b6bfea90b6ad7f5b61253d9e27b03224aa69e10","observation_id":"13052108-b106-43fe-8134-5a5b9cf59b3f","resolution":{"observed_at":"2026-08-12T12:25:00.363060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.556504Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"778f51b7-e1b4-442d-b42c-b749a620ddbd","year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.365716Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:c2bdf34e34f281ba585e2f1b1cbe278432ff4515becac8d1a65aa6a030926a2e","observation_id":"6956228f-437a-49b9-924a-2f03b47292b4","resolution":{"observed_at":"2026-08-12T12:25:00.559249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T12:25:00.368115Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.368115Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:5e3e1925e463874fcc2601f855df0eca972e78d94be2b7782e3a6cdff9c8e85d","observation_id":"d9fce147-c50d-4345-a667-700ba991a541","resolution":{"observed_at":"2026-08-12T12:25:00.368115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.370673Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.370673Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:5c92d48fe3b8f5240ddf9fc0db213c019c0466f5408497dcab0d057abcfe4b4f","observation_id":"0dd63667-5baa-4b2c-a5ee-0bf1ad13ba94","resolution":{"observed_at":"2026-08-12T12:25:00.370673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05208","last_updated":"2025-02-04T02:54:38Z","snapshot_observed_at":"2026-08-13T11:46:46.856046Z","submitted_at":"2023-05-09T07:00:17Z","title":"Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05208","snapshot_observed_at":"2026-08-12T12:25:00.372991Z","title":"Boosting visual- language models by exploiting hard samples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.372991Z"},"links":{"cited_paper":"/paper/2305.05208","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:4dc3a98435e918aace825e66f1dae431078a340839a7fe73aa09ae6ec10a8dc5","observation_id":"5357ac85-5fa8-4cb4-9c01-a3e34be52516","resolution":{"observed_at":"2026-08-12T12:25:00.372991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T12:25:00.375740Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.375740Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:6aedb7c8fb5df535b2a4d309c407768584889411c03edec35cdfe6149de41211","observation_id":"0b66a686-60c9-43f5-8695-8dfcd767f616","resolution":{"observed_at":"2026-08-12T12:25:00.375740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.544009Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"238decbc-84c5-463f-9f94-1ff24ad543d0","year":2022},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.378156Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:e3299d4d4bc6266f9d704bc55fdfa5b8ebaa212375b61627164a70b57313bd50","observation_id":"4df0f32f-6fbc-4d4e-b8ea-51feb0162fd8","resolution":{"observed_at":"2026-08-12T12:25:00.548185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-12T12:25:00.380558Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.380558Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:94abbb0d6f857224745128e4c4ebc3cbf0c3cf3bc29be66fb221f67aa5dcff1c","observation_id":"5ecc5ec3-ec4b-4125-a631-81b5b5c457dd","resolution":{"observed_at":"2026-08-12T12:25:00.380558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-12T23:53:00.854564Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T12:25:00.383749Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.383749Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:e8023c4189c678d6999326bb0701ae0ca784ead10aff2ff7529f4acffe09a9ec","observation_id":"ae0cb8b0-25e8-4e56-a9ff-a24c72415139","resolution":{"observed_at":"2026-08-12T12:25:00.383749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-13T00:10:37.900129Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-12T12:25:00.386323Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.386323Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:083075f5a5ddfa840d55f5bbb7ee315175e53f27b36aa3cf8e2b21d08f1b310b","observation_id":"49af9acd-90f2-4ab2-8674-a7dcf84265aa","resolution":{"observed_at":"2026-08-12T12:25:00.386323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-13T04:53:04.807772Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-12T12:25:00.388877Z","title":"Tinygpt-v: Efficient multimodal large language model via small back- bones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.388877Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:5655e674f2b64d067c9acdb1803f82bde3a5d4a3f33c249d248133e60b561830","observation_id":"4e842cc9-a5c7-4467-b472-628f30265967","resolution":{"observed_at":"2026-08-12T12:25:00.388877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:25:00.391401Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.391401Z"},"links":{"citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:0a61442e343c6e477758c78bec468285b9fcbdee8f6cde9726e86e4271f3c3ff","observation_id":"1a9a7bdd-8385-4453-a25e-79d65249bb9c","resolution":{"observed_at":"2026-08-12T12:25:00.391401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-12T12:25:00.393682Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.393682Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:8297fbb94131b3f6e879f248d84d3e5bc5ae255b64a7232b83d0c3e0550ce863","observation_id":"b6806a50-cea7-4973-82db-3383cef06e19","resolution":{"observed_at":"2026-08-12T12:25:00.393682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-13T04:13:12.046147Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-12T12:25:00.396491Z","title":"Tinyllava: A frame- work of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.396491Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:56f45f133d80b6086e7eba86dca8e0099046cf07dac714349b9a5388127a44e8","observation_id":"0471f26e-8674-48b7-bf4f-07ea6732e36c","resolution":{"observed_at":"2026-08-12T12:25:00.396491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T12:25:00.399099Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.399099Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:c42c9ba79768f84f00261508ceb509122c3cc0166725b575ddbeac03aaa1f5af","observation_id":"c17ded9e-09bf-4628-a2fd-3688b23fad5b","resolution":{"observed_at":"2026-08-12T12:25:00.399099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:03:52.544268Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2411.17773."}