{"as_of":"2026-08-16T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:612651446d33f5b14f976e17e78965458ded07646bbb5f955aa12dc0ee9a6e87","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:40:42.781755Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T16:18:24.126708Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T13:10:26.487893Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2411.10557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2411.10557 (2024) 5","venue":null,"work_id":"73e31010-4530-4397-a113-106675610988","year":2024},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:24.304696Z"},"links":{"cited_paper":"/paper/2411.10557","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:ef98da91dbc4e0a6a7e52d94f0a6c406dd0755554a02fc66f4c7ea85fe666b8a","observation_id":"8acd7226-56ec-4171-9346-72650e6a5002","resolution":{"observed_at":"2026-05-10T13:10:26.490363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10557","snapshot_observed_at":"2026-08-02T16:18:24.126708Z","title":"arXiv preprint arXiv:2411.10557 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:24.126708Z"},"links":{"cited_paper":"/paper/2411.10557","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:10ca77c115b7be7cd4781a07056f6203862235f7a79528f733efa3512be322f1","observation_id":"1b97072f-21a9-4f1d-ab2d-99dd4ee0940b","resolution":{"observed_at":"2026-08-02T16:18:24.126708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10557/citation-record","integrity":"/paper/2411.10557/integrity","json":"/paper/2411.10557/citation-record.json","paper":"/paper/2411.10557"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-12T19:40:42.453769Z","title":"Jiang, Kartik Khandelwal, Timoth \\'e e Lacroix, Guillaume Lample, Diego Las Casas, Thibaut Lavril, and 23 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.453769Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:b474e4b02223e4c935681183b48698df6eb0f87624c0f077d5924e33b9a954f6","observation_id":"6640628e-1f76-4b2f-a3eb-e04023c6f1f9","resolution":{"observed_at":"2026-08-12T19:40:42.453769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.459444Z","title":"Menick, Sebastian Borgeaud, and 8 others","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.459444Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:8214c070a2ec95ad3ac9f168ef2aa7f71f52d87c137a573d874def9ee3a49b9c","observation_id":"8eee1435-fbfb-476f-9fc7-d9760d3cdaaa","resolution":{"observed_at":"2026-08-12T19:40:42.459444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-16T14:03:39.369872Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-12T19:40:42.463605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.463605Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:377b64a6c32b7f4842d10858b99a0562c1755d7a2f00e94567205b459a4058cc","observation_id":"83e7bb51-3887-470c-ba5d-80a6ebdc8a48","resolution":{"observed_at":"2026-08-12T19:40:42.463605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T19:40:42.467941Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.467941Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:bac95a3539c1a2b94327bd51c1eb98aae8987b806abdd0042a63c5906f0bb947","observation_id":"a62ee92a-bb06-4ff0-a673-c77c5329ae97","resolution":{"observed_at":"2026-08-12T19:40:42.467941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-12T19:40:42.472829Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.472829Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:71a7dd865bc37fe4ff67ec197a23420ae557438969772e25f66b08ffccf304c9","observation_id":"fac90c31-d961-4d8b-b949-f02f4d467099","resolution":{"observed_at":"2026-08-12T19:40:42.472829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03315","last_updated":"2021-02-05T17:41:43Z","snapshot_observed_at":"2026-08-14T05:51:44.839702Z","submitted_at":"2021-02-05T17:41:43Z","title":"Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.03315","snapshot_observed_at":"2026-08-12T19:40:42.477323Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.477323Z"},"links":{"cited_paper":"/paper/2102.03315","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:50d76d0af9fdc07957a23ef79244b824ee2c6d370923ac0a22feb60a3203f734","observation_id":"34cd048f-ec61-45eb-b472-9e6563dff5ad","resolution":{"observed_at":"2026-08-12T19:40:42.477323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12119","last_updated":"2026-05-29T11:31:58Z","snapshot_observed_at":"2026-08-16T12:57:36.047964Z","submitted_at":"2025-02-17T18:43:41Z","title":"PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12119","snapshot_observed_at":"2026-08-12T19:40:42.482100Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.482100Z"},"links":{"cited_paper":"/paper/2502.12119","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:8388e85d150a51abc09cf7b20d0c02b6aab859f5932ac474bffbad1d07653d30","observation_id":"7d97c25d-234d-4da0-98dd-fa4d3c534a11","resolution":{"observed_at":"2026-08-12T19:40:42.482100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-12T19:40:42.486583Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.486583Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:dfdf33ceb862021d3ba671987000fb25b290c4b932741161b1db13bff4512d93","observation_id":"cce5ba45-a306-44e8-a6d8-5273286ccf9e","resolution":{"observed_at":"2026-08-12T19:40:42.486583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08350","last_updated":"2024-10-23T02:16:37Z","snapshot_observed_at":"2026-08-16T14:10:16.959925Z","submitted_at":"2024-03-13T08:54:31Z","title":"CoIN: A Benchmark of Continual Instruction tuNing for Multimodel Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08350","snapshot_observed_at":"2026-08-12T19:40:42.490462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.490462Z"},"links":{"cited_paper":"/paper/2403.08350","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:b067ab0484745a4707820f8b74581cf3c005295cd0720f33879b366dbc4c89c9","observation_id":"c1c8555e-67e7-4989-a907-9c972e65b844","resolution":{"observed_at":"2026-08-12T19:40:42.490462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i16.29727","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.065964Z","title":null,"venue":null,"work_id":"841cb3cc-ead1-46e4-bbee-dab8ac5c8227","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.494402Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:d941acae69e1dd8eced5a3e9574075a4d69e9b02b72ac80c3e06254e433a9d5b","observation_id":"cdfea1f6-494d-46b9-ba57-835a77327e07","resolution":{"observed_at":"2026-08-12T19:40:43.070614Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T19:40:42.498269Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.498269Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:3f08b42ed8e014b67c455a8973bebde4b341da445e1b93f2f0340cab9e0ac0fb","observation_id":"d208cd4d-6c51-45f3-beb9-68f896ae23b7","resolution":{"observed_at":"2026-08-12T19:40:42.498269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12501","last_updated":"2024-02-19T20:08:48Z","snapshot_observed_at":"2026-08-16T14:17:11.528452Z","submitted_at":"2024-02-19T20:08:48Z","title":"Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12501","snapshot_observed_at":"2026-08-12T19:40:42.502268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.502268Z"},"links":{"cited_paper":"/paper/2402.12501","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:2f58663184c9fc9157937d9f63128c394befa11fb87a64268e4354b000fc0450","observation_id":"0c62c1f4-78b7-4690-b8cd-fab8addf4b22","resolution":{"observed_at":"2026-08-12T19:40:42.502268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-12T19:40:42.506298Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.506298Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:5e16e21c4876cfd3569a6cb89447992d0c60d9db10ab817a1418accb6bed867c","observation_id":"4dda7dd7-fa79-4ffd-890c-ee16d485a093","resolution":{"observed_at":"2026-08-12T19:40:42.506298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-12T19:40:42.510137Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.510137Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:41faaf3c591bc34f307dc68105427180738f1f9446f55b13a7bc8d0a5bd3962f","observation_id":"b9fde89c-20c6-4db4-a486-42993de63d3d","resolution":{"observed_at":"2026-08-12T19:40:42.510137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.514156Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.514156Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:1e78e65e8d8b3f6092cb7c3e637ebac8c1d6a47b2099749506e4096b1a7c79cf","observation_id":"c612df4e-df6d-42d2-abc1-aaf22eb467d1","resolution":{"observed_at":"2026-08-12T19:40:42.514156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.517827Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.517827Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:9c4bb01739709a22d67c63fef5c7d7728d8c3919317557e641d29115d5e34f08","observation_id":"a40693f8-5669-4e64-9fbd-8e350f9d770b","resolution":{"observed_at":"2026-08-12T19:40:42.517827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15621","last_updated":"2025-07-31T12:41:25Z","snapshot_observed_at":"2026-08-16T12:48:29.353107Z","submitted_at":"2025-03-19T18:10:12Z","title":"LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15621","snapshot_observed_at":"2026-08-12T19:40:42.521585Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.521585Z"},"links":{"cited_paper":"/paper/2503.15621","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:e3e0ca4d3aade5ef90ee6d106de9d908fa1c32855e0ad0aaefcb514ec3b9d9d0","observation_id":"93706ca6-5114-46ac-8f68-e5e62870d8b9","resolution":{"observed_at":"2026-08-12T19:40:42.521585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-16T13:17:44.282942Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-12T19:40:42.525574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.525574Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:17074fc21fcf6b4e4d63d54c8fce877bae7865b542736238cb0e2e6ea74ddc83","observation_id":"b5ebbd63-31ab-4f00-b4e5-6ea9bf0509fd","resolution":{"observed_at":"2026-08-12T19:40:42.525574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.529349Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.529349Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:e6cd39a4c3ac21271979acce4ef8e6b0bacc0df075ac0b79d89d2b512c6df929","observation_id":"ab78f917-a45a-404a-b82c-e664514228e7","resolution":{"observed_at":"2026-08-12T19:40:42.529349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-12T19:40:42.532980Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.532980Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:45a9599f691f9eda42aac44fb9b870363321b5e8015bc30324aca787d977c871","observation_id":"d6840438-4494-4881-8707-4c44a07f818c","resolution":{"observed_at":"2026-08-12T19:40:42.532980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.697765Z","title":null,"venue":null,"work_id":"15a9c562-39bd-4aa8-a839-0917835f84bb","year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.536912Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:f3890d1c32dcaf309fe66526aec64bb30c791ef73c90d2ad7f324440b42f64f7","observation_id":"a84f2385-991b-45a5-acb8-0c81a0e9570d","resolution":{"observed_at":"2026-08-12T19:40:43.702447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T19:40:42.541265Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.541265Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:306c26b05f0e4e0a1d705feb1543efa37080f6171385f8dc68a11b09970971f6","observation_id":"1d3991e1-53d2-4e50-8661-e1e939c0695d","resolution":{"observed_at":"2026-08-12T19:40:42.541265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T19:40:42.545283Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.545283Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:8dcf38121d2a0a5ee35d9428292bf35320fb79004ceb275a76619b08859d05a3","observation_id":"720fb7c2-c9dd-425f-b563-4bb96ecb6653","resolution":{"observed_at":"2026-08-12T19:40:42.545283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-12T19:40:42.549353Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.549353Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:3a491e8f29a997962c83ad13bf6fcd73e4cd3b6e931800b9d26dec25ea9d7e76","observation_id":"c2c1992d-510d-418b-aa86-6969b1ff7e30","resolution":{"observed_at":"2026-08-12T19:40:42.549353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.553119Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.553119Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:6b74c6a5ae3a79535d1d78114e26864251420a65cb46c0969083bcb465a8d547","observation_id":"1ddc537b-6f4f-4716-af0b-f810c4cc969b","resolution":{"observed_at":"2026-08-12T19:40:42.553119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.684299Z","title":null,"venue":null,"work_id":"97ef32e4-900e-40e7-bd18-41006b2926b1","year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.558151Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:e5efa23b1e67627b892ea5cb66b993e72fccd1ee9caa1b59542beb29b0ead9e3","observation_id":"aa015089-ab4f-472a-95db-d230bcd15a95","resolution":{"observed_at":"2026-08-12T19:40:43.689109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.672401Z","title":null,"venue":null,"work_id":"6c66ffd6-1154-47c8-b93c-6611b5fd4e7d","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.561720Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:d01b80754de76375a3b6fabe3ba8d2362c3ac232453d7fcccce86fc0f472b029","observation_id":"0d05fe6e-b93d-4f98-bad0-35c304746b20","resolution":{"observed_at":"2026-08-12T19:40:43.676387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.565908Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.565908Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:783dae4b02d3bd32cb29a8f8a5b3e84aa4c083e6d167cccef912200ad22ce260","observation_id":"c6933b3e-f3c4-4c8c-9268-61937e617775","resolution":{"observed_at":"2026-08-12T19:40:42.565908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-16T13:55:33.670920Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-12T19:40:42.569577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.569577Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:43bd7471e40b81dd322d67eb856453b0affe95392262ac80c279fa97efa0c33b","observation_id":"5bf2afc3-fd47-4e3f-99c4-ee272330d34f","resolution":{"observed_at":"2026-08-12T19:40:42.569577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10995","last_updated":"2024-10-02T17:20:28Z","snapshot_observed_at":"2026-08-16T13:42:32.365920Z","submitted_at":"2024-06-16T16:15:20Z","title":"Concept-skill Transferability-based Data Selection for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10995","snapshot_observed_at":"2026-08-12T19:40:42.573683Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.573683Z"},"links":{"cited_paper":"/paper/2406.10995","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:9c64092fa7e7fe9deb946dc4a67620abab290849958f0b6090d7b603bf8049ff","observation_id":"485dc3d0-408a-4b81-a44f-2a990f5959cb","resolution":{"observed_at":"2026-08-12T19:40:42.573683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.660706Z","title":null,"venue":null,"work_id":"719a3ef8-f679-46a9-9944-d27e9690eee9","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.577545Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:f392f3ab755868082c9d49fff4dc9524071a91d2fc6439b2ab714c30fa616f65","observation_id":"ce6e33d9-a189-4bf6-a50c-048d2e723077","resolution":{"observed_at":"2026-08-12T19:40:43.664693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T19:40:42.581170Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.581170Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:b119122376404b4f734240fee2ae584caad89c79366268ab601ef211eef75a9b","observation_id":"96088eb9-e931-4562-a9ea-c27d0b001a18","resolution":{"observed_at":"2026-08-12T19:40:42.581170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.649420Z","title":null,"venue":null,"work_id":"c29d6231-7acc-4ae2-a775-9f0069815955","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.585116Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:d46362a79b3d3776220c5e260a7df57e1e9ebe07465d42ece4d6bd65b51abd8e","observation_id":"f65b51c9-c97f-46c1-a44a-50ae8cc4b413","resolution":{"observed_at":"2026-08-12T19:40:43.653346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-12T19:40:42.589248Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.589248Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:8035bb4da9eada0e177a50fcbf402bbacdc979f570dd7466a96e38b8ff4c9a9a","observation_id":"4de431ff-65f5-44e9-aeee-65a5dc09c83a","resolution":{"observed_at":"2026-08-12T19:40:42.589248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.637223Z","title":null,"venue":null,"work_id":"94d0b27c-ec71-4ed0-9eae-6a3c78c76812","year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.593147Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:3045a062203ab28bc4ada55d0d3857ff8d6457254532a52351ec34ba606a355e","observation_id":"b8e47bcd-c410-4088-be5e-c3bb9579b31a","resolution":{"observed_at":"2026-08-12T19:40:43.641105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.596917Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.596917Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:890f9716e5137d71b431572499ebad8a9784feb84edb6769828174db47a3a0c4","observation_id":"fd0545c6-9229-4ae3-a000-c64bd324aa02","resolution":{"observed_at":"2026-08-12T19:40:42.596917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-12T19:40:42.600729Z","title":"https://doi.org/10.48550/arXiv.2501.14818 Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.600729Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:64325117f458d9c022f7c07ad5a871d324dd60b868e4311b8b1c22cc1a0683e0","observation_id":"574ea3d5-4e38-4d39-97c6-9ef73ea13448","resolution":{"observed_at":"2026-08-12T19:40:42.600729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-08-16T14:35:22.253216Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-12T19:40:42.605065Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.605065Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:94a0aecfc6e586f837ecb49d3ff75cc71df5b80b3f45eb9936b0c41ebbb9a743","observation_id":"ffeaa00f-eaa7-4934-868f-518e7ebe69ca","resolution":{"observed_at":"2026-08-12T19:40:42.605065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T19:40:42.608960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.608960Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:513a78fcf530a0d8a6863167ee27da7bd92474da4a2e37b951ac476032be9842","observation_id":"cb13ae8e-11c4-4a48-b3fd-b141071cb6d9","resolution":{"observed_at":"2026-08-12T19:40:42.608960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.612932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.612932Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:683c65371185304619de1858667bdcfef706e3a0e0e71b1443a25151c9adb4fd","observation_id":"38825169-85c8-472a-a3d3-375ef9e1b86d","resolution":{"observed_at":"2026-08-12T19:40:42.612932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.616741Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.616741Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:d884407e82801415d798e23ec31e4d3faed2329c2197b941fc90df21ecd4982d","observation_id":"148cf4db-aebe-4b54-a72a-68ae9914d994","resolution":{"observed_at":"2026-08-12T19:40:42.616741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00723","last_updated":"2025-03-20T21:26:06Z","snapshot_observed_at":"2026-08-16T12:53:55.583240Z","submitted_at":"2025-03-02T04:11:03Z","title":"Re-Imagining Multimodal Instruction Tuning: A Representation View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00723","snapshot_observed_at":"2026-08-12T19:40:42.620682Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.620682Z"},"links":{"cited_paper":"/paper/2503.00723","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:0b8f5132a558a97544003d9c42408393f18c993eb82814b0918174c283ae237b","observation_id":"90e16809-c56a-4446-9cba-7f73fbf72531","resolution":{"observed_at":"2026-08-12T19:40:42.620682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.610663Z","title":null,"venue":null,"work_id":"b7acefc0-99ba-4028-8ed7-0ab5c787bad4","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.624641Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:f12ff340342d21acaef97e5c7a4b2b7ab63d6458ae7ad581db1dfa6aa85e8f4e","observation_id":"e0310cfa-2dc2-4fb7-a26f-8e0ecf148da0","resolution":{"observed_at":"2026-08-12T19:40:43.615004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-12T19:40:42.628347Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.628347Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:2716b416e3c797ad32d10cfab2c9b97670e2f81f19faf55645bad2e03ba7bc51","observation_id":"5b4a343d-7fb3-42fe-a459-72d59a9ef5db","resolution":{"observed_at":"2026-08-12T19:40:42.628347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09559","last_updated":"2024-10-10T14:16:13Z","snapshot_observed_at":"2026-08-16T14:09:45.677289Z","submitted_at":"2024-03-14T16:47:25Z","title":"Less is More: High-value Data Selection for Visual Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09559","snapshot_observed_at":"2026-08-12T19:40:42.632427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.632427Z"},"links":{"cited_paper":"/paper/2403.09559","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:1c7a60fa378f4ad7979beb9dcbdcc68919c8ccfd0f2865f49699515b4fb08580","observation_id":"5bed965c-5a2b-48e6-b6ed-9cd888793dfb","resolution":{"observed_at":"2026-08-12T19:40:42.632427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.636399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.636399Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:e95c88b49fa98cf95bab5293f2990d94f3cfe924f2481fd7d6081c48b5ce8c80","observation_id":"155db7cc-a646-4a02-af10-19b85b930bfb","resolution":{"observed_at":"2026-08-12T19:40:42.636399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.590454Z","title":null,"venue":null,"work_id":"c552fa43-b856-42fc-9059-18d19efcdf63","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.640156Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:ecde560313eb049a915e85ae27764d296456402634bc2dfca1c0147ac8869f88","observation_id":"783212b8-c0ba-4ee5-9010-884a9c2d0da9","resolution":{"observed_at":"2026-08-12T19:40:43.594231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-12T19:40:42.644042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.644042Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:74b5c25193aa0851b8f313af89ebc7c17acee9eb0901a64459b3d313379f3be9","observation_id":"b752e3bc-fcae-47b8-a70d-a151f267eed1","resolution":{"observed_at":"2026-08-12T19:40:42.644042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.576980Z","title":null,"venue":null,"work_id":"c9e8e8b9-86a5-403d-90ed-3fd844589774","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.648044Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:1617bc1685a5f84cb5713427dcaeb35b276702f0d1f926f20c780f2ae94e0d85","observation_id":"4e484e3d-fffb-4723-aceb-719112084acf","resolution":{"observed_at":"2026-08-12T19:40:43.582731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.564910Z","title":null,"venue":null,"work_id":"749ec3b8-b279-4fc1-9511-d0fcd7958120","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.652117Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:920ea8e16d7dca7664b472cc750309230c172b21cd0cc0d592a41366b59c674f","observation_id":"8251e597-288f-4fec-9ba6-9d76a153fac1","resolution":{"observed_at":"2026-08-12T19:40:43.568930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T19:40:42.655698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.655698Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:1558b6877e00cbfeab2ec9887e136a91ccfc6727027f67462d2f604ea16c426e","observation_id":"c40c5414-64c0-42b2-863c-679d98ce9b0c","resolution":{"observed_at":"2026-08-12T19:40:42.655698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T19:40:42.659569Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.659569Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:7654abb7a20c405db7c9f5eed0429d23cb8ee1fbb04d63fa713f7085bffabd38","observation_id":"7479fab0-70ee-4e5e-b768-18359f731462","resolution":{"observed_at":"2026-08-12T19:40:42.659569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.663579Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.663579Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:ac9c78952d1b769fe856d844fadc101483760e1b981765796e415f09775a2779","observation_id":"06249b53-2489-48db-a4ad-945d436756e5","resolution":{"observed_at":"2026-08-12T19:40:42.663579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.667776Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.667776Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:49f849d973528be3d2dabb362ff5fa34323f21fedcfe992fc714aea03141c668","observation_id":"9da322d5-fdad-45aa-b62f-437c9f51ecfc","resolution":{"observed_at":"2026-08-12T19:40:42.667776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-12T19:40:42.671797Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.671797Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:1289183b5caea2200ea29096a1c486ae022912321e74d9d620e2c8f83d5557e5","observation_id":"d3170461-0384-465f-a2dd-b0d5c76563b6","resolution":{"observed_at":"2026-08-12T19:40:42.671797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07591","last_updated":"2025-04-05T15:13:01Z","snapshot_observed_at":"2026-08-16T13:24:04.330460Z","submitted_at":"2025-03-10T17:55:11Z","title":"Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07591","snapshot_observed_at":"2026-08-12T19:40:42.676920Z","title":"Patel, and Shao-Yuan Lo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.676920Z"},"links":{"cited_paper":"/paper/2503.07591","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:76248ef560e37a1af4b49003f0b952268a8fdb804d57d9350ff436295274cbde","observation_id":"a8049146-2ddc-4b79-b76d-c852fad4b72a","resolution":{"observed_at":"2026-08-12T19:40:42.676920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.680892Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.680892Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:6e8d2aa567ca9f446225212e8e64beec368d0fc248d538d8ed396be37f2dadcb","observation_id":"94504570-f047-4d28-99f3-13590c268123","resolution":{"observed_at":"2026-08-12T19:40:42.680892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.685043Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.685043Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:8d0f6f7301cb1a88d04a6c4989dab22b2aa20abdf01051d32a2133ad62a870fb","observation_id":"e41992fc-0679-4583-a537-e159d379a408","resolution":{"observed_at":"2026-08-12T19:40:42.685043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T19:40:42.688690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.688690Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:a1dd3012c29e05b375df167ad711e8d6480494969811d4212b1f18f1d3af5925","observation_id":"f2722003-0d8a-4fce-b275-b9ee158e1e13","resolution":{"observed_at":"2026-08-12T19:40:42.688690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T19:40:42.692567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.692567Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:e505b496f78ee37e41a155c85ee5445244179f706c9facacf1c9f0a5b786b079","observation_id":"f1930942-d071-4705-bf22-e0af3eed1818","resolution":{"observed_at":"2026-08-12T19:40:42.692567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T19:40:42.696778Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.696778Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:609a68f2412c3068b164312d642c3f9c2d03f1839f2b1ab5f021762d871a7386","observation_id":"ab14157a-b46d-4a97-ada1-7e52ac8bcd9b","resolution":{"observed_at":"2026-08-12T19:40:42.696778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-15T15:06:42.719366Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-12T19:40:42.700417Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.700417Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:7aee9ceddea55dfca9ec783ab3e967b609f32d581df9df627ba5c9c91d07f6ea","observation_id":"4854e0f1-19ac-4bf9-ac41-61d65d613e94","resolution":{"observed_at":"2026-08-12T19:40:42.700417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.531042Z","title":null,"venue":null,"work_id":"76493bf7-2ddc-4253-b2c1-1e31ee3ab99d","year":2022},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.704521Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:1931c043ba78d5e317b51a792228165e52bd64ab093e46c5b92c51b63ba9ef17","observation_id":"630963b3-d6ea-4ee9-ad3d-c5de5f4ee58c","resolution":{"observed_at":"2026-08-12T19:40:43.535605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.708391Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.708391Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:971d73812c5f1a380a93e3eb714d5994d5e68fe9ac3995a8cd8cd2ccc0024b4c","observation_id":"320de8c6-c717-419a-83fb-0e950befbb24","resolution":{"observed_at":"2026-08-12T19:40:42.708391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-08-15T03:39:02.471554Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-12T19:40:42.712119Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.712119Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:959d5d932290ad3ba34e3f05759982d9c7f6534c22505bc5c24ab0197c4ec6d1","observation_id":"b4d993cc-6aa9-47e7-a9dc-60833a1d0153","resolution":{"observed_at":"2026-08-12T19:40:42.712119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20454","last_updated":"2025-09-08T21:35:19Z","snapshot_observed_at":"2026-08-16T13:30:03.412486Z","submitted_at":"2024-07-29T23:18:55Z","title":"CoMMIT: Coordinated Multimodal Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20454","snapshot_observed_at":"2026-08-12T19:40:42.716482Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.716482Z"},"links":{"cited_paper":"/paper/2407.20454","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:971dc1b9058da14e2bbd656f254ba4129e67fc4a597b4925c6716926042b844b","observation_id":"61c32a33-ba26-4107-872f-0b0a8720b2ab","resolution":{"observed_at":"2026-08-12T19:40:42.716482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.512404Z","title":null,"venue":null,"work_id":"e633b720-08cb-45f0-8806-2a060e552e0e","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.724196Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:7c89d7aada6e64fa12a9c22871589aa26dce3597cdf2af8f8e68cce8080e1ce6","observation_id":"3d2124e3-6008-4c8d-b541-60d9955cae42","resolution":{"observed_at":"2026-08-12T19:40:43.516388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.728138Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.728138Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:2f898b59ad2d799fc3d89535bd6257573a2a1e35398819a92bbd3df42f68a6a4","observation_id":"87bba81b-9cfe-4387-abe0-f0c9b2fedb45","resolution":{"observed_at":"2026-08-12T19:40:42.728138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T19:40:42.731755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.731755Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:3c648f34df46865ebea0a7c3260bdab7fe5b35e3fdc1ac72d78d6dbd6c96ecaa","observation_id":"803635d8-d28d-41a2-9609-8a3db5d02526","resolution":{"observed_at":"2026-08-12T19:40:42.731755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.735464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.735464Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:2f12014d0a26024882ad9754605df753c764343944946c84f2a4cf96446d6835","observation_id":"3199a348-74f5-4d4f-854e-7cc2603d317d","resolution":{"observed_at":"2026-08-12T19:40:42.735464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-12T19:40:42.739274Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.739274Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:2ad38347a07b09143db29cda0b45b0f51020a53ecd157d88ef89cfdce2ab2813","observation_id":"f7988f76-ef8b-4748-98a0-e818b715a49b","resolution":{"observed_at":"2026-08-12T19:40:42.739274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.743326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.743326Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:86651a8d381b793830cad9f27ecc0595ff9492d43d3c985438faf7ec8ecf8964","observation_id":"505d491b-3c21-4805-bc08-d714e48aeff1","resolution":{"observed_at":"2026-08-12T19:40:42.743326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.440","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.829678Z","title":null,"venue":null,"work_id":"9f41be64-c514-4f30-994a-9dd0fecdc774","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.747395Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:2161b8fba0648329a87d235027a3d8c4d5bb7f31638b42b5e8c70900afcc79a4","observation_id":"a43a9663-f214-40e8-8a17-17c718f04e9d","resolution":{"observed_at":"2026-08-12T19:40:42.834751Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.751405Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.751405Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:567a94eda443c21799bf890d0c8b9052a1deee0c11a229b589a634c7dd4b0cbb","observation_id":"68013ae3-bab8-45e7-923e-1f4c93df1693","resolution":{"observed_at":"2026-08-12T19:40:42.751405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-16T13:14:01.160794Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-12T19:40:42.755109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.755109Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:07b52f4484cb4bcc3d2ad3f967019ad13bb9bdf34266d2ccf8424b48d263a419","observation_id":"39cd69e3-c3d6-42ea-b13b-c6bb5f859be1","resolution":{"observed_at":"2026-08-12T19:40:42.755109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-12T19:40:42.758925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.758925Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:03b358e51b9aabf249972f2236f7a3f575ffd75204426ccb77f6c5ced04643be","observation_id":"de67c9bd-cdd5-42c1-8366-f22096f77ef9","resolution":{"observed_at":"2026-08-12T19:40:42.758925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.762788Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.762788Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:1f3821477fe066655177d78cde548372d40d48e2705cf40fe2a38ed7b2b55c28","observation_id":"d7a8e5b6-af63-4cb7-8b17-40e3115bdc86","resolution":{"observed_at":"2026-08-12T19:40:42.762788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:43.490398Z","title":null,"venue":null,"work_id":"cb561176-1687-4ad6-9fed-2a858b174d6e","year":2024},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.766262Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:8df5f5c4e7ef7bc82308648afcc3c5b754e66520f5afba0e5c0f9152b12df974","observation_id":"54685fc8-0ecb-4c87-8753-28d2ffb88a33","resolution":{"observed_at":"2026-08-12T19:40:43.494471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.769941Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.769941Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:bab84db61e69c059347563049483b80304037da5f8760cc5d16d7c5f4ead8f9a","observation_id":"c2f997f2-bb75-415f-acd8-b4af259eb051","resolution":{"observed_at":"2026-08-12T19:40:42.769941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T19:40:42.773447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.773447Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:21da686ac7f5726cace7f8b253ed0e95ed25260f08a35f81ea299ca9e6431ccd","observation_id":"d792cc92-f534-42ef-a054-25c5d629f71f","resolution":{"observed_at":"2026-08-12T19:40:42.773447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.777691Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.777691Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:7191f0c3f3a9d6cfc52282c80c36784704b1b77f6361d78c8f1250ca6348acad","observation_id":"d40d9fa0-7a88-4c1f-b5c8-fb781f6727ad","resolution":{"observed_at":"2026-08-12T19:40:42.777691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:40:42.781755Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.781755Z"},"links":{"citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:0c37c2cb85874435b034c4fec705b3a24e5383e0250457781aec5775db893450","observation_id":"0c2a470b-a7f6-4e55-bdcc-cdb51cad634f","resolution":{"observed_at":"2026-08-12T19:40:42.781755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T17:10:21.064845Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 2 inbound Pith citation observations for arXiv:2411.10557."}