{"as_of":"2026-08-16T01:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53ddb0edf68790a53a32b47c2ab37c8348b4005ffd369094b198203c8f380047","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:37:54.891321Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12787/citation-record","integrity":"/paper/2411.12787/integrity","json":"/paper/2411.12787/citation-record.json","paper":"/paper/2411.12787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.675226Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.675226Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:45144f39b76024f37cfe07ae9c7dfef6fa7dd816304232f2cc71fb0011bda853","observation_id":"d7f1bee5-c5be-4905-b8ca-a43edb0dd259","resolution":{"observed_at":"2026-08-12T17:37:54.675226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T17:37:54.681289Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.681289Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:5194e53f0090c273f0b1312f2c7cab25a9735b257e3583727b075f1188eb8604","observation_id":"a26616b5-c94c-419a-a46a-4fef259519f5","resolution":{"observed_at":"2026-08-12T17:37:54.681289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T17:37:54.687801Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.687801Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:59f80821811fb46c501e77fc4ab9b2dd1f2e990da9be525653244bef9455b1cb","observation_id":"2b986d2a-0096-41de-86b8-ffc475aaa73e","resolution":{"observed_at":"2026-08-12T17:37:54.687801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T17:37:54.695363Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.695363Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:5690b821ce928bd4dd28b84c9a47ec0619dbeaf0b3624b864d98afa847fb8794","observation_id":"5afec7ec-c18a-4f90-ae8a-94c76f4ef2bc","resolution":{"observed_at":"2026-08-12T17:37:54.695363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16160","last_updated":"2024-01-30T15:44:58Z","snapshot_observed_at":"2026-08-16T01:16:17.007831Z","submitted_at":"2024-01-29T13:48:36Z","title":"LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16160","snapshot_observed_at":"2026-08-12T17:37:54.701624Z","title":"Llava-mole: Sparse mixture of lora experts for mitigating data con- flicts in instruction finetuning mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.701624Z"},"links":{"cited_paper":"/paper/2401.16160","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:5f8b09ef86c1777de45e61ca1be6b570a67e22ba5defc84bec56d35487375c1a","observation_id":"66132ade-bf2d-4a37-b9ba-22066cb3ef22","resolution":{"observed_at":"2026-08-12T17:37:54.701624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.709703Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.709703Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:e8cb372910ae44560bcfc7a02d80c83e415acf9c20ef867b9cb908652aef1b7c","observation_id":"2f5db9c4-0d15-41d3-9a10-32912c279eef","resolution":{"observed_at":"2026-08-12T17:37:54.709703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.715260Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.715260Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:b5d9189353709cc96e1afb0770274c5094ffc48a1d7cb18ac4ffb30eb2dbb9ef","observation_id":"08921ef2-c25c-45a5-97d2-dde53a6983fd","resolution":{"observed_at":"2026-08-12T17:37:54.715260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.720473Z","title":"Parameter-efficient fine-tuning of large-scale pre-trained language models.Nature Machine In- telligence, 5(3):220–235, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.720473Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:1a6249ac26f376e2c31590c0f95b6dfb381c310f84c22153802d1c541d5ab0d5","observation_id":"0da724d6-0a78-47c3-bf3b-d571344a3133","resolution":{"observed_at":"2026-08-12T17:37:54.720473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17221","last_updated":"2024-01-30T18:09:11Z","snapshot_observed_at":"2026-08-14T08:52:52.282135Z","submitted_at":"2024-01-30T18:09:11Z","title":"MouSi: Poly-Visual-Expert Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17221","snapshot_observed_at":"2026-08-12T17:37:54.726053Z","title":"Mousi: Poly-visual-expert vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.726053Z"},"links":{"cited_paper":"/paper/2401.17221","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:15acc3aaab4d4746eabbbd60823147cb16c527530064243c0126b4c8cf778fed","observation_id":"a6e169af-b8f8-4e5e-bdd5-e05a896e9cc3","resolution":{"observed_at":"2026-08-12T17:37:54.726053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.712632Z","title":"Deep sparse rectifier neural networks","venue":null,"work_id":"1c1b19d4-83b0-41d6-82d2-21377de57228","year":2011},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.732437Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:a6d1c5e4b6340e71b2fdd41368767a69846273802cbc157bf6b6133289da40f8","observation_id":"791b1a21-74a6-4ede-ba5f-e9c4af2a9656","resolution":{"observed_at":"2026-08-12T17:37:55.718337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T17:37:54.738181Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.738181Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:bf37b38bb90bc893a412bd36b8ab96db75163d03d5b8f8414abc3df1e529d639","observation_id":"95eb8dfe-3c88-4319-944f-85912b3452dd","resolution":{"observed_at":"2026-08-12T17:37:54.738181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.743855Z","title":"Harder tasks need more experts: Dynamic routing in moe models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.743855Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:3ae25d173b7c6ed99cd9b1ec0e5d8757810959d4c0be4049131d101ea4ac5382","observation_id":"acacf141-d1a7-492d-b5b9-3c6f8cf9c8e3","resolution":{"observed_at":"2026-08-12T17:37:54.743855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12730","last_updated":"2024-12-16T06:16:27Z","snapshot_observed_at":"2026-08-15T04:15:54.725927Z","submitted_at":"2024-07-17T16:49:34Z","title":"RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12730","snapshot_observed_at":"2026-08-12T17:37:54.748872Z","title":"Rode: Linear rectified mixture of diverse experts for food large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.748872Z"},"links":{"cited_paper":"/paper/2407.12730","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:503d862d88bc29033d21d67d6089619d3a70364c357292dcea3e96cf33409eec","observation_id":"0f0c4c9c-b5a1-4e67-961f-33c073ec933b","resolution":{"observed_at":"2026-08-12T17:37:54.748872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.693635Z","title":"Unlocking textual and visual wisdom: Open-vocabulary 3d object detection enhanced by comprehensive guidance from text and image","venue":null,"work_id":"af4f51d3-06e5-4d11-befb-ef96e8360044","year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.754030Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:2303447076118cbd72c44250b25a832dbcb6e0a3aee052d5b631bfe987a3e58f","observation_id":"2cae4764-886c-4fa6-92aa-ae68254158f4","resolution":{"observed_at":"2026-08-12T17:37:55.699366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09456","last_updated":"2025-04-13T06:47:32Z","snapshot_observed_at":"2026-08-14T03:59:51.221688Z","submitted_at":"2025-04-13T06:47:32Z","title":"Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09456","snapshot_observed_at":"2026-08-12T17:37:54.759113Z","title":"Don’t deceive me: Mitigating gaslight- ing through attention reallocation in lmms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.759113Z"},"links":{"cited_paper":"/paper/2504.09456","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:a87017664163eee8a311a6969e6f641fffe1f934747d8bb8c54a58e97a04104b","observation_id":"7ad139bc-c6db-4689-ac7b-37cdb056f429","resolution":{"observed_at":"2026-08-12T17:37:54.759113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.676863Z","title":"Lumen: Unleashing versa- tile vision-centric capabilities of large multimodal models","venue":null,"work_id":"f1ead88d-b6cf-49b3-b790-de966f0673a6","year":2025},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.764630Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:730f5e60344001edd7cbb99452f2bd982dfcc02d3164208c29c31c4f9afd198e","observation_id":"8e8fdd22-c8c3-4c82-b9b2-96d3439bc3a4","resolution":{"observed_at":"2026-08-12T17:37:55.682222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.770220Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.770220Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:e430bbfa0f0bab6da08a45f516545c69e6e48d3c124328b98452ccdc1234065c","observation_id":"7da838a1-9d43-4d58-99a5-22b63f4f3261","resolution":{"observed_at":"2026-08-12T17:37:54.770220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.775267Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.775267Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:613968529f05a85bb0fa2c6aaad102c09ec7c6360ecc04fd0529f9fd349e5701","observation_id":"c7b873ba-d7bf-4ae4-b205-0edc508b4c29","resolution":{"observed_at":"2026-08-12T17:37:54.775267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.780768Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.780768Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ec92dc881011480996dbab119acebf90bd7cb96017b68c8b179255be2819fc2d","observation_id":"eccca891-7eb6-4474-bd9e-d6cc548c56e1","resolution":{"observed_at":"2026-08-12T17:37:54.780768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.620393Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"be0fa673-9668-4a20-9364-5ed617f9fd3a","year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.786295Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:207bd7bfdd83fda8ef5a5bc886acc6831e3be598586f56817bd4ca6f71e428f0","observation_id":"95104aa3-f445-495f-93da-ecc27bb27c04","resolution":{"observed_at":"2026-08-12T17:37:55.625708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.599932Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"778ca0b1-4e56-4522-aa8c-fc7e3b2b23da","year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.792350Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:b7989f71e2445af1ff9ea20b5a3ed0b1f5990d214f07d9ba2e3fe83aa5809714","observation_id":"480ba212-1816-4dbd-9758-2dd3d696f467","resolution":{"observed_at":"2026-08-12T17:37:55.606297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T17:37:54.798888Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.798888Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:c8b71181848585026abd8ddb243927285b6fa5e73a2d883f37e28f449a7ae015","observation_id":"9823dec1-cb94-42d7-a37d-f41e97f3ed15","resolution":{"observed_at":"2026-08-12T17:37:54.798888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00361","last_updated":"2024-08-10T05:26:24Z","snapshot_observed_at":"2026-08-13T00:17:49.849948Z","submitted_at":"2024-05-01T07:33:43Z","title":"AdaMoLE: Fine-Tuning Large Language Models with Adaptive Mixture of Low-Rank Adaptation Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00361","snapshot_observed_at":"2026-08-12T17:37:54.805675Z","title":"Adamole: Fine-tuning large lan- guage models with adaptive mixture of low-rank adaptation experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.805675Z"},"links":{"cited_paper":"/paper/2405.00361","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:6cb0e8186c5b338e660d03892a6f49db3a354a955738e97c9e957ef5009f1305","observation_id":"0f5cf207-ebb8-4ff4-a6c4-54c25a6b83e6","resolution":{"observed_at":"2026-08-12T17:37:54.805675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T17:37:54.811609Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.811609Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:e528371fcee0ebf054b00421a4f56d599c1b1d86807aefd5d25bd1190e3b97c3","observation_id":"2bf07059-d448-4a95-9510-58703b1ff33f","resolution":{"observed_at":"2026-08-12T17:37:54.811609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T17:37:54.817637Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.817637Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:0737bb15ad635b0dda1c94cab7a0cfac56928c196ab77961a85de120be8bd5f8","observation_id":"d93f0c8e-19ec-4a4a-b20d-2101feb765f4","resolution":{"observed_at":"2026-08-12T17:37:54.817637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.581988Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"4d227ce4-1e2d-4873-8649-9244b0d7848d","year":2015},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.823531Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:7763055b64b63b01da0016f823ee142654574507bbbda7cdc07318e56c79ff03","observation_id":"16286e8f-2876-4b89-9ad0-6c6ad8ab5879","resolution":{"observed_at":"2026-08-12T17:37:55.587874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08771","last_updated":"2018-09-12T14:13:33Z","snapshot_observed_at":"2026-08-14T19:22:47.534657Z","submitted_at":"2018-04-23T22:54:55Z","title":"A Call for Clarity in Reporting BLEU Scores","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08771","snapshot_observed_at":"2026-08-12T17:37:54.828772Z","title":"A call for clarity in reporting bleu scores","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.828772Z"},"links":{"cited_paper":"/paper/1804.08771","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:0185194be12c58e02839005b68ee735c5904401a90faaeeb6f4c86c8aa983259","observation_id":"4167a38d-3880-40f4-a5ef-164b61f5a131","resolution":{"observed_at":"2026-08-12T17:37:54.828772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.565042Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"0e5ff243-a476-4d34-b585-213f4bb0d8d8","year":2021},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.834854Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:4b645483032f28bc2d137754feb11458ea6240807c8859b1b22d538a2de2b3e4","observation_id":"61538d55-5b18-46f5-b59e-c707a540807b","resolution":{"observed_at":"2026-08-12T17:37:55.570322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.539262Z","title":"Scienceqa: A novel resource for question answering on scholarly articles","venue":null,"work_id":"feb41bdc-0970-4395-923f-ced7d7649d20","year":2022},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.840309Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:e7ed1b51f1259694b0b1533c73463ca89dc52e5e3bbed4dda01bbdc6ae046cc6","observation_id":"780a05aa-8369-4659-8f5a-6edb99520912","resolution":{"observed_at":"2026-08-12T17:37:55.547356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T17:37:54.845427Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.845427Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:f4e9a7ae00a6dfaa0fe80f49ae49219a092471ca58cdec177caf0982f186c237","observation_id":"ecd51877-14f4-4d05-b97d-ea703d8943f3","resolution":{"observed_at":"2026-08-12T17:37:54.845427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.850908Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.850908Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:267317bffdd36651902c33b12055642982b88dc434a1ff2570a4662c135af924","observation_id":"031c52a2-023b-4533-841e-c6bbe7f3c87c","resolution":{"observed_at":"2026-08-12T17:37:54.850908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T17:37:54.855723Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.855723Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:12edad78f450944286a59c514ebf992cd22406a8b7d4456c5766d8a338d213d6","observation_id":"264b8c67-1619-472e-9c4c-6c98e158f314","resolution":{"observed_at":"2026-08-12T17:37:54.855723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13628","last_updated":"2024-04-21T11:59:53Z","snapshot_observed_at":"2026-08-13T00:25:17.233474Z","submitted_at":"2024-04-21T11:59:53Z","title":"Mixture of LoRA Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13628","snapshot_observed_at":"2026-08-12T17:37:54.861350Z","title":"Mixture of lora experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.861350Z"},"links":{"cited_paper":"/paper/2404.13628","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ffd4ed756d91cfc29b72238d2397a3b5719dd4ab0698ef366a6c3176450c2ea8","observation_id":"1a8cebf6-8ead-4290-9bfd-00fc64a31cf5","resolution":{"observed_at":"2026-08-12T17:37:54.861350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.503803Z","title":"Vision transformer with deformable attention","venue":null,"work_id":"f7a7ada6-21d5-4e8a-85f6-04ce8c048496","year":2022},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.867653Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:67b9f807d64b851541f1c22bc38f95c744b620656e58428d197da5f3cda6cfe9","observation_id":"9663fe63-948c-4bfd-9f35-dc7e1365bfa1","resolution":{"observed_at":"2026-08-12T17:37:55.511682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-13T00:51:59.402203Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T17:37:54.873349Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.873349Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:023eae48276fc35acc7d72a5a201dfb286da7634abaccf2d077485772d11e215","observation_id":"6aee29cb-5595-4836-be2c-d468dbc7c14c","resolution":{"observed_at":"2026-08-12T17:37:54.873349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14991","last_updated":"2024-04-12T14:21:20Z","snapshot_observed_at":"2026-08-13T04:55:22.304306Z","submitted_at":"2023-12-22T11:56:22Z","title":"FoodLMM: A Versatile Food Assistant using Large Multi-modal Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14991","snapshot_observed_at":"2026-08-12T17:37:54.879662Z","title":"Foodlmm: A versatile food assistant using large multi-modal model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.879662Z"},"links":{"cited_paper":"/paper/2312.14991","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ca26f3bc62875be6467daf297882719eb43099c67f450e7da3ae64ccfe4f4878","observation_id":"c651cc23-de9b-469f-b8a4-48eb6bd89114","resolution":{"observed_at":"2026-08-12T17:37:54.879662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T17:37:54.885564Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.885564Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:371eb401aee8df7e6de05d928922fb3d929190e1b135d4e5cbd29dcba1ad6b00","observation_id":"bce9786f-9c3d-4cdd-8eeb-1345393caf8c","resolution":{"observed_at":"2026-08-12T17:37:54.885564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-12T17:37:54.891321Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.891321Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ec9d5981c0235b5e15985508ffe0c2fc278b3b9e15684daba61640beffcd7196","observation_id":"b787204d-0eae-4bab-a0a2-258eadc739e8","resolution":{"observed_at":"2026-08-12T17:37:54.891321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2411.12787."}