{"as_of":"2026-08-16T23:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:002fc37470f27de47dd07d1014ebd2bdf07959b232fbcb49c7af944b420d7e41","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:42:13.979447Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T18:08:56.044278Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:31.831734Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"cited_work":{"arxiv_id":"2506.16691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16691","snapshot_observed_at":"2026-07-04T03:19:31.831734Z","title":"arXiv preprint arXiv:2506.16691 (2025)","venue":null,"work_id":"f6edef53-9fa0-49ae-a9f4-368e46d6a652","year":2025},"citing_paper":{"arxiv_id":"2507.21420","last_updated":"2026-04-28T19:54:45Z","snapshot_observed_at":"2026-08-13T06:15:37.784587Z","submitted_at":"2025-07-29T01:07:09Z","title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-19T03:18:11.993413Z"},"links":{"cited_paper":"/paper/2506.16691","citing_paper":"/paper/2507.21420"},"observation_digest":"sha256:810dfe3ce5c8696c8faf3516889fb8ad19589eff99f9bfa673220a794aa43323","observation_id":"29312d64-c8fe-498a-bfda-894e49983ae1","resolution":{"observed_at":"2026-05-19T03:22:01.181799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"cited_work":{"arxiv_id":"2506.16691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16691","snapshot_observed_at":"2026-07-04T03:19:31.831734Z","title":"arXiv preprint arXiv:2506.16691 (2025)","venue":null,"work_id":"f6edef53-9fa0-49ae-a9f4-368e46d6a652","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-08-13T16:20:55Z","snapshot_observed_at":"2026-08-16T22:11:26.513714Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2506.16691","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:be5d4d7b6f4ba7eb05e362844efb0811f09df5311eaed2fc6b1fc3dc53c0a557","observation_id":"a6862ffb-5dcc-4899-848e-b4b0aa1d8cdb","resolution":{"observed_at":"2026-07-04T03:19:31.833880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16691/citation-record","integrity":"/paper/2506.16691/integrity","json":"/paper/2506.16691/citation-record.json","paper":"/paper/2506.16691"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:42:11.467453Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.467453Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:6c1d835dfa8f6791f739dbf5138d268ea51afe99cf8eb068ac448ef492eae0f2","observation_id":"9aee4c1c-04f1-4f91-87fa-21060a6a7576","resolution":{"observed_at":"2026-08-06T23:42:11.467453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T23:42:11.568556Z","title":"Flamingo: a visual language model for few-shot learning.ArXiv, abs/2204.14198, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.568556Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:b6f7b23c8d16ecae84544e45ebb0d7c9f4b173fb4059daddc15401a8e86f65c1","observation_id":"5ddc843a-52dd-4c47-bc13-381f8f0a0edb","resolution":{"observed_at":"2026-08-06T23:42:11.568556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:11.685462Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.685462Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:9440037f16b623cebe20eae4ab6304edccf39140bc47b0c1bedba84e342fc569","observation_id":"02645f41-f1cb-41ec-b2a7-d7dea623420d","resolution":{"observed_at":"2026-08-06T23:42:11.685462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:11.820401Z","title":"The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.820401Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:505c5b45fcd17fc32432e90fa9ae66407579d7c41715243d9b6081eef1493a15","observation_id":"9dc02497-c659-4e8c-8485-0fe1dc005226","resolution":{"observed_at":"2026-08-06T23:42:11.820401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:11.964755Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.964755Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:4ac9ab86f9e3e401fb693963f2465255dc57a00402054e30623ae409446f0132","observation_id":"a6e64210-2b0a-4bfd-980a-64efcfea572c","resolution":{"observed_at":"2026-08-06T23:42:11.964755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T23:42:12.116980Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.116980Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:7eff665de56f69368b20b3b671bbb4108265c8700ea9ffe47844e03069f7e96b","observation_id":"2c3e6796-1489-41cb-9281-7828da2465a2","resolution":{"observed_at":"2026-08-06T23:42:12.116980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T23:42:12.195256Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.195256Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:635d3bf156f6d6bf71be2c622ec1d5e7b28d822f081479797aa6ef8b352072d5","observation_id":"88557c66-ee15-4964-a694-9fe9e21332f9","resolution":{"observed_at":"2026-08-06T23:42:12.195256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T23:42:12.353821Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.353821Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:1c86cee0c4c17140c65796e22b5fae32befeb1340979f6002b3ad195bd2475f4","observation_id":"b14f4bd6-4b83-419e-a955-1f6fc8c0609e","resolution":{"observed_at":"2026-08-06T23:42:12.353821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.758393Z","title":"Nltk: the natural language toolkit","venue":null,"work_id":"45a10678-f21b-40e9-bea7-dfe84bb69771","year":2006},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.478544Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:f65da7a2dfd3c7bc69ca94ed0e6d1cbb0ff5a5348c1af38fad2a42a9ef3352ef","observation_id":"20014592-ddc7-4c9d-ac48-4e5e6e5bce6b","resolution":{"observed_at":"2026-08-06T23:42:14.761772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:12.608375Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.608375Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:13be6602c62956df1b3fe062977988415f46f3badb64fd22f9bf2f6bc4a37fed","observation_id":"82b5761f-a244-4e85-a8c3-af36bc21f00c","resolution":{"observed_at":"2026-08-06T23:42:12.608375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:12.745946Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.745946Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:ece07a329666055cf8df76779a7cd8cd02842652bdb53bbae616b9729bf934f7","observation_id":"6c0cd4ff-faab-4b10-8712-113e8b02756c","resolution":{"observed_at":"2026-08-06T23:42:12.745946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T23:42:12.861061Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.861061Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:0ece07ea4436e25a89ecda0881de14f4dd6a31e5d22603f08e67808b693e6b66","observation_id":"7381ecb4-c8b7-408c-aeab-a652d13bdaa3","resolution":{"observed_at":"2026-08-06T23:42:12.861061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.731470Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"35ea1286-5823-49fb-9a30-a24adbb00710","year":2020},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.987283Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:fc0812a6d291adcaf233dbf403d4774124ed4c76032e84640e82bb85a79c0c03","observation_id":"86ed57a2-71bd-40c1-853d-80c33517ed53","resolution":{"observed_at":"2026-08-06T23:42:14.735153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.104331Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.104331Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:9e9d24868dcb631a7b5a14c8ebc302dec775add3a9f39b66617a235f54086734","observation_id":"5bee69ee-7818-46a8-9df8-f73dd6b562f5","resolution":{"observed_at":"2026-08-06T23:42:13.104331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.115317Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.115317Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:3248d55dc37bd03fd86001051ac5d045d121b622e24d5ae16c2d23459b34254b","observation_id":"462315c5-df46-4cd5-902b-3e7e4a06829e","resolution":{"observed_at":"2026-08-06T23:42:13.115317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T23:42:13.221205Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.221205Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:04899984ca638ce4f967daab0e951690f73f17ba8042e055283e4fb3db37bec7","observation_id":"df06f042-e510-4e5b-9b2e-e0738b1bc496","resolution":{"observed_at":"2026-08-06T23:42:13.221205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.312034Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.312034Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:dd84fa05cad4e8a45db4042a5dcc27e93b33318ec94aa31a267d34583d3cac4b","observation_id":"79fbf471-1e39-4852-ba00-21bc3a6d6044","resolution":{"observed_at":"2026-08-06T23:42:13.312034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T23:42:13.454102Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model.arXiv preprint arXiv:2402.03766, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.454102Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:2f99ad0139aef2a435cf4636d89acb27d2f8c540fe26bea00695766515d8cefa","observation_id":"0d6832b0-410d-4b1f-92d6-4cc10e3b1c2e","resolution":{"observed_at":"2026-08-06T23:42:13.454102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T23:42:13.573381Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.573381Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:fa64300d96ffc8d9b7486ebdf969f9eed4ba5e38732e81de6c468df297ecb0ca","observation_id":"449027db-9c5c-4f6d-8032-641bcdf7cb38","resolution":{"observed_at":"2026-08-06T23:42:13.573381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T23:42:13.643721Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.643721Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:f2aad067c6543464f1b67e32f408ea81ef89c27a37a332b93759124f807eb486","observation_id":"13947f52-783b-454a-91fa-8130a6778368","resolution":{"observed_at":"2026-08-06T23:42:13.643721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.647604Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.647604Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:80a90cc6cfe382b72e86a4e873179cef973ed8dac274e64fcbc42c4829750688","observation_id":"1b2efe2f-aa52-4eb1-9131-c6e27d88536d","resolution":{"observed_at":"2026-08-06T23:42:13.647604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.651057Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.651057Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:f406c4ecc90fefc7f848fe7b4df8195922dfc3c4567efd1b6260319c83c7c114","observation_id":"95f8fe7e-d105-4ad8-81f1-b0a2a69cf37a","resolution":{"observed_at":"2026-08-06T23:42:13.651057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.659269Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.659269Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:2375e699a311e0d8aa57d0f22624b96dd8c3bb6930ae3b1c3f56ff9c058811fd","observation_id":"7e0b6d1c-7c87-40ec-9329-9ffcb2d1820f","resolution":{"observed_at":"2026-08-06T23:42:13.659269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T23:42:13.664483Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.664483Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:34497ed424f709918abea81062e358aa0df13213435b0eefb0a9943d5e84b28d","observation_id":"78709f2e-cfab-4f01-bf8a-e7c4225d944f","resolution":{"observed_at":"2026-08-06T23:42:13.664483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.668729Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.668729Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:08f8ffa29c6612aad0a90b9bb17e5b3808c31ef0d7bc8ec8b9adbbea0403c59a","observation_id":"48cc5443-fa87-494f-b4f2-7827e6dc9681","resolution":{"observed_at":"2026-08-06T23:42:13.668729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.672831Z","title":"Revisiting visual question answering baselines","venue":null,"work_id":"12bb3ec4-a75f-421b-b534-7c92bdec8f98","year":2016},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.673567Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:08439c83a648015680c35ca8dabd7a9db7a3ab30da9f49eb3fc1146181f974c0","observation_id":"ae2c4f91-7e96-4078-b5a6-3d1d269e129a","resolution":{"observed_at":"2026-08-06T23:42:14.677213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T23:42:13.682523Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.682523Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:28f24f4c3fa769f112ac154e3e59e58beddd54af55ac33286a4a5b9977bd48f3","observation_id":"12d634bf-4016-487f-8859-b9e3e94c7490","resolution":{"observed_at":"2026-08-06T23:42:13.682523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.686298Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.686298Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:3e461a6761f8db453f653e0f8172f08f8d4b200599eadd553a0d5465baebfd04","observation_id":"ce93ee01-fe91-472f-bcf2-f0a7db191003","resolution":{"observed_at":"2026-08-06T23:42:13.686298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.691664Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.691664Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:ebcec51e80f616f42e57f28fb418bf378a3e328f8e34bba239d02f41d1341450","observation_id":"723cb2b3-701b-41ba-b3d1-7188ab3ff7da","resolution":{"observed_at":"2026-08-06T23:42:13.691664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.704172Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.704172Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:6f99bd72748a7af08bcdb31533094c2fd74d60e3a465d99ce18180512335e020","observation_id":"30b5d714-c6a1-48e9-9f0c-1694aef87db8","resolution":{"observed_at":"2026-08-06T23:42:13.704172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.707741Z","title":"Align before fuse: Vision and language representation learning with momentum distillation.Advances in neural information processing systems, 34:9694–9705, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.707741Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:c94652ff793b8e888300fbff9efe9eecb478ff156090a490e530c622c1124c3a","observation_id":"d4b2980e-3966-49a0-8db7-1f6893e8df60","resolution":{"observed_at":"2026-08-06T23:42:13.707741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.608418Z","title":"Videochat: Chat-centric video understanding, 2023","venue":null,"work_id":"77622ef5-04a7-4763-acf9-e47a12e05f24","year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.711251Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:370e080ad21c43ced025105ff310587e8e3e298d303e074b101c00f9bda9d366","observation_id":"97785b96-6907-414c-b42a-18ef2769ef47","resolution":{"observed_at":"2026-08-06T23:42:14.611889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.717277Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.717277Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:315fc1bd027d9d9c8a578da3debd662e24d669c4f2011b40fe56806fdca688a5","observation_id":"e2db0624-1235-4266-9b1c-cdaaacf9840a","resolution":{"observed_at":"2026-08-06T23:42:13.717277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.725584Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.725584Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:c866d9660efa95917d91bf302e924d3724ab0a6edca03b7b7ca18f4384fb4141","observation_id":"b47862b3-ec9f-4319-b291-e06a96870b66","resolution":{"observed_at":"2026-08-06T23:42:13.725584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T23:42:13.730319Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.730319Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:a2724bfc65f9328c4e46a906b654a795a1565735abfddd36438ba1eb89269a0a","observation_id":"8622997f-673b-4e3f-a8c5-87bf0c700d2f","resolution":{"observed_at":"2026-08-06T23:42:13.730319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-06T23:42:13.735467Z","title":"Moe-llava: Mixture of experts for large vision-language models.arXiv preprint arXiv:2401.15947, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.735467Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:8154dd426f6675096bd05b8ff1a9c1dbc0a50e930413563969eb273d91749765","observation_id":"a231d075-a609-4905-b05a-9bab02935191","resolution":{"observed_at":"2026-08-06T23:42:13.735467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T23:42:13.740088Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.740088Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:64672f76bf7e136b9637fc4d6add65ef9ea3cc17f1dd223a68f79fdd1dbf2cb5","observation_id":"5b8cf93e-0509-4b35-8c94-f8154c1d8458","resolution":{"observed_at":"2026-08-06T23:42:13.740088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-16T14:20:06.718576Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-06T23:42:13.746024Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models.arXiv preprint arXiv:2402.05935, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.746024Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:e6b59bec4581e1a8ecfa01449fc7ed9e22f2f4521c29b74ab61893f80367bd5d","observation_id":"ce0f5d7b-3421-45af-b0a9-5c6c2810d65c","resolution":{"observed_at":"2026-08-06T23:42:13.746024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.754518Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.754518Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:2cce3eaff7b679caeaf16411f49e8f1dcc763824bfb6e3cea6953e9ce69d4d5a","observation_id":"019916fc-4086-4e9e-ba18-06309506835d","resolution":{"observed_at":"2026-08-06T23:42:13.754518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.759294Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.759294Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:bc7f95eb4d14058fb9745500af219b895f2425fd18fa3fe30c87c8134342c65a","observation_id":"403461a0-177e-4689-a44c-3525b9891f31","resolution":{"observed_at":"2026-08-06T23:42:13.759294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.762862Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.762862Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:9ff0bece8464ae6d2fb73516e3aca9814c4e31c4c9cca6a5b9dd02f2a109ac64","observation_id":"297559bd-906f-46be-b760-ff7b5aa00b18","resolution":{"observed_at":"2026-08-06T23:42:13.762862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.770024Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.770024Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:94eeb4687c4f03f13ed3da8a14f896ad68a8d86b36d4f7e27d804cddb84c2bcc","observation_id":"cdd77114-445b-4867-9373-2a5056bc7b38","resolution":{"observed_at":"2026-08-06T23:42:13.770024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-06T23:42:13.773647Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks.arXiv preprint arXiv:1908.02265, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.773647Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:00b499e475528fdcdc710952028167cd1d9093b14da3271e6ab821f515caf946","observation_id":"8519c36c-eef2-429e-aa49-9d5a12ae840e","resolution":{"observed_at":"2026-08-06T23:42:13.773647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.778621Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.778621Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:64f8d3f07c382fe5306ee824d726e655d28ea0daa85096ea6e5bef0f6d78ac6a","observation_id":"67b001ae-295d-45cf-906a-cafeb2cb178e","resolution":{"observed_at":"2026-08-06T23:42:13.778621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-16T13:10:34.900051Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-06T23:42:13.784958Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training.arXiv preprint arXiv:2410.08202, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.784958Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:d6022f55a64f3d8bbe85c64c368937a067333fa6a26bbfb4e28455a11ac75005","observation_id":"a59232dd-a6e0-4986-affb-a787d45ad1d7","resolution":{"observed_at":"2026-08-06T23:42:13.784958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T23:42:13.788990Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.788990Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:207fab8c6a593a84e7095255833040920696e1fcdc502bc1b2504a946c395a6f","observation_id":"c7bf4ee0-a720-4031-a320-aec3d66ec9fa","resolution":{"observed_at":"2026-08-06T23:42:13.788990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.793581Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.793581Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:fdf8e180f94d02d8b65e3451e6c0bfa78ce729971e706afa555d95f993acf244","observation_id":"af78bd7e-562d-4997-bc73-5b3ee4c2cb8d","resolution":{"observed_at":"2026-08-06T23:42:13.793581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.798585Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.Meta AI Blog","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.798585Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:3bf8761a2612c366223596732ce907bb4f2a504bac0722f5689a0e0a73250780","observation_id":"a4a41ed7-6599-47f3-bd10-b788e8688ad2","resolution":{"observed_at":"2026-08-06T23:42:13.798585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.801951Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.801951Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:86374c520341a75ed5a87ea08b3df26cf1cbd73f7f018609754c490af8756b30","observation_id":"e6d8f519-7a59-4d74-9593-14d47ac90e97","resolution":{"observed_at":"2026-08-06T23:42:13.801951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.521274Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 2019","venue":null,"work_id":"042d680a-084f-4c97-8f12-91b2c30a00d4","year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.809976Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:f4a89c8a27132ebe624fc5252504ef917b6599d35be27baf36e7d19d86442de2","observation_id":"0fdf2af3-937f-4bc1-ac7c-302b208475d2","resolution":{"observed_at":"2026-08-06T23:42:14.525704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-06T23:42:13.819653Z","title":"Searching for activation functions.arXiv preprint arXiv:1710.05941, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.819653Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:283a1b30e67cc5ace200e944a399282f652b5673df54a5e63f96b0c333acd55f","observation_id":"82f9ab2e-4bd1-4a08-917c-5cecb7d27d47","resolution":{"observed_at":"2026-08-06T23:42:13.819653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-16T13:52:43.594422Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-06T23:42:13.831606Z","title":"Cinepile: A long video question answering dataset and benchmark.arXiv preprint arXiv:2405.08813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.831606Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:fc53d3c9e35638c746f298b627d1d309385cd2a72065985f9a0892c2bba9f3bf","observation_id":"b7754035-5226-457d-a5d6-8fd86eda5e15","resolution":{"observed_at":"2026-08-06T23:42:13.831606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.836198Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.836198Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:739e162e4f3a66e3bc1f6afc23190b01b7c6806c0fb486818372a9825c80bbf7","observation_id":"18327225-f708-490a-a6ed-ddbf008e6d03","resolution":{"observed_at":"2026-08-06T23:42:13.836198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.500708Z","title":"Flops profiler, 2025","venue":null,"work_id":"635d7efc-1b63-4d1c-83dc-94d3155ba146","year":2025},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.843580Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:46e6dfee07484c2112dcf10b03acc86a1237cb5ce3506cc73dbf1bd8cb22417e","observation_id":"63618e8b-195e-4ee8-969e-b82cdfb805f5","resolution":{"observed_at":"2026-08-06T23:42:14.505878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:42:13.848825Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.848825Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:9e23947dda91bc0bfdd5ef82e895123b21e19a15a8a5ad250eba02cafaf5b0fb","observation_id":"578a6673-3b6e-455d-8f3a-493a78cf7456","resolution":{"observed_at":"2026-08-06T23:42:13.848825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.852755Z","title":"Mlp- mixer: An all-mlp architecture for vision.Advances in neural information processing systems, 34:24261–24272, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.852755Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:0c9f85621a62e3d8d6b42bce519dd81882fc97d40d8b0d85791ec9c553f7af70","observation_id":"bb38303f-ae63-4e72-844c-9059286c1dbc","resolution":{"observed_at":"2026-08-06T23:42:13.852755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T23:42:13.863089Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.863089Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:11e9e592199984362cc41b93b0414f794b0336400fbf2a7481edaa9cd6526d18","observation_id":"ab8e50e7-81d8-4492-a41f-7c3711c74420","resolution":{"observed_at":"2026-08-06T23:42:13.863089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T23:42:13.878802Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.878802Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:62324438c7be598ef1e967f4b95f6fef7ede1f7a0b3d6ba0eb0cd5e74277fe6a","observation_id":"2debb5ab-3107-4b9d-bc1a-d9f60141ed15","resolution":{"observed_at":"2026-08-06T23:42:13.878802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09792","last_updated":"2022-01-24T16:42:56Z","snapshot_observed_at":"2026-08-16T17:26:21.757559Z","submitted_at":"2022-01-24T16:42:56Z","title":"Patches Are All You Need?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09792","snapshot_observed_at":"2026-08-06T23:42:13.886946Z","title":"Patches are all you need?arXiv preprint arXiv:2201.09792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.886946Z"},"links":{"cited_paper":"/paper/2201.09792","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:bbdac45c9e48bb500d442b9c88d879d2a8397c80aa3138d5bda49fc136392d9b","observation_id":"e808306e-e95a-40df-a2bf-51795d5012aa","resolution":{"observed_at":"2026-08-06T23:42:13.886946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.890551Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.890551Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:9749a93df896a173b1c5a788f188cc24024db6087522d2f6a4e5eb5f0d88d94e","observation_id":"a476ad82-1e46-458e-a4f5-f3e88a671a9e","resolution":{"observed_at":"2026-08-06T23:42:13.890551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-16T21:48:39.601976Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-06T23:42:13.894002Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference.arXiv preprint arXiv:2406.18139, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.894002Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:c6682a82193331f6460da4f49c2af0e27b3b144a84c128e3462e7fa0a0ed3e7b","observation_id":"fdea2b54-0b7f-49e1-965a-c3998b9c5e04","resolution":{"observed_at":"2026-08-06T23:42:13.894002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.472492Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"1186b4c8-887d-4aa9-8e37-aa51cf8c5b58","year":2025},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.903098Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:46bd3b56387426783e583c0a12827d076a69af383b7e70a80051ba1e570d521b","observation_id":"556e51c2-2ca4-4449-9009-2ac112aa07e0","resolution":{"observed_at":"2026-08-06T23:42:14.475667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T23:42:13.912263Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.912263Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:4126b3b3e9579fd08563e6a65637429534da1d38f4381ff958ffda366f7ff17e","observation_id":"4716d017-f258-4481-801d-4b9bdde49b55","resolution":{"observed_at":"2026-08-06T23:42:13.912263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.458779Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":"bea911e1-276f-4af2-8e35-9967ee32ac55","year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.916176Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:3bb9984614f051ff9a6b3b9c191fe663816715a39df6cd3164846cdf70b00091","observation_id":"90372d15-99a1-4b77-8d32-c05862fa7573","resolution":{"observed_at":"2026-08-06T23:42:14.464007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.447737Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"b3328630-d77c-42c0-b6e3-cb34a9f46703","year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.920019Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:f2aa737b721c1774e042baa1b897e41fa043bbb4050b742fd0ec85c8586852b7","observation_id":"1843186c-721c-4ef5-9ade-c338527de335","resolution":{"observed_at":"2026-08-06T23:42:14.451218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T23:42:13.923332Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.923332Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:e1cc53503b813ee3672c32fe6b5a9d0f1742e11b1db90f5e6d62e06718547799","observation_id":"9467c2b3-921c-48c6-a38b-87433cedbbc4","resolution":{"observed_at":"2026-08-06T23:42:13.923332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.930971Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.930971Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:5896363fc5ea43de317ce492c130e1be19fca2d71e5dfba97c06c061563eee39","observation_id":"d2685d41-a199-451c-b56c-5dd04ca1235d","resolution":{"observed_at":"2026-08-06T23:42:13.930971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.947456Z","title":"Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.947456Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:18cef2089fab43491134f18bdda8cbfa8fe917b7b2c10a770b563863da752709","observation_id":"601d00e5-a49a-4575-8f25-1aa2ee7a768e","resolution":{"observed_at":"2026-08-06T23:42:13.947456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T23:42:13.955406Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.955406Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:25c4faaabd12c48d37ad79a6b0aa2543530ac7c254ad2f409fc72c6fc0c17b09","observation_id":"de1d6570-519c-4776-876d-ecf848bd4c48","resolution":{"observed_at":"2026-08-06T23:42:13.955406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T23:42:13.967404Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.967404Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:4c5b47070861ea16f6746a4c5015aeab1950603c28efaacf15139f93ed07b609","observation_id":"ed01f621-792c-4699-afb1-f54e0c1f7f6d","resolution":{"observed_at":"2026-08-06T23:42:13.967404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:42:13.971332Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.971332Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:8bbce7b5688a29d63217a7e2d4239a4de1163f252a2e536f5c88bcfa0bf1a0c3","observation_id":"35bc73c8-054a-4132-919a-d3a9d7e7a3e6","resolution":{"observed_at":"2026-08-06T23:42:13.971332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03496","last_updated":"2024-06-05T17:59:40Z","snapshot_observed_at":"2026-08-16T13:45:47.040077Z","submitted_at":"2024-06-05T17:59:40Z","title":"Wings: Learning Multimodal LLMs without Text-only Forgetting","version":1},"cited_work":{"arxiv_id":"2406.03496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03496","snapshot_observed_at":"2026-08-06T23:42:14.036479Z","title":"Wings: Learning Multimodal LLMs without Text-only Forgetting","venue":"cs.CL","work_id":"612bc2a1-4db9-4dff-bc95-b44a54478c73","year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.975077Z"},"links":{"cited_paper":"/paper/2406.03496","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:a20bddc3e94ad6e33fefc282d4a40d9e9242f865bab26db6e253fe4f0c759672","observation_id":"149c2511-5fae-4c5e-9958-47f2b52cd5fb","resolution":{"observed_at":"2026-08-06T23:42:14.042993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T23:42:13.979447Z","title":"U n e x p e c t e d # visual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.979447Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:02e8b924d741a608360167b7cf5460c75219f80b5ba99348c4f4dc321b2d4309","observation_id":"7abdeaac-5cb1-4a79-9983-d83daf5b6c7d","resolution":{"observed_at":"2026-08-06T23:42:13.979447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T08:26:20.416328Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 2 inbound Pith citation observations for arXiv:2506.16691."}