{"as_of":"2026-08-11T18:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e2a6485e45329b55909d6eed09d3e3d61fbc24f807d2e4e10f474a82928a6c2","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T01:04:00.817362Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.08443/citation-record","integrity":"/paper/2501.08443/integrity","json":"/paper/2501.08443/citation-record.json","paper":"/paper/2501.08443"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:00.506708Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.506708Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:9ac8ff57171a22f9bff1e25a3b1bf474caa7bb19193813961962dd1d0622b796","observation_id":"be73d4bd-ef57-42ee-874f-f9a60d38f61d","resolution":{"observed_at":"2026-08-11T01:04:00.506708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:02.132268Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"e3a408cf-603b-44a2-94ac-9fef1142a1aa","year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.513042Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:ed5b08f88e480f094fa2e08718dadb1c16824ee841c4c8279601fdb3748be5d0","observation_id":"8490bfac-f1e6-4a41-aa93-ec56dabbd854","resolution":{"observed_at":"2026-08-11T01:04:02.139224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T01:04:00.518915Z","title":"Minigpt-v2: large language model as a unified interface for vision- language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.518915Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:646caf5c99b3b237037e8c63a1392418695ec3b05d86bef041744b23048670c7","observation_id":"d701c504-7e14-4aa5-8d31-d043187974f5","resolution":{"observed_at":"2026-08-11T01:04:00.518915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:02.097288Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":"d9535e70-a446-4fd1-9988-ae0506fd21a9","year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.525814Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:394905bff2eeffdfc57d4ae326e7c294ad7aefdb08040f6b0357ee05a8672c93","observation_id":"89922604-efeb-46ff-9162-fa71417b4beb","resolution":{"observed_at":"2026-08-11T01:04:02.104871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:02.065591Z","title":"Talk2bev: Language-enhanced bird’s- 29 eye view maps for autonomous driving","venue":null,"work_id":"0dc76729-c1d1-428e-95cb-d01fabe85de4","year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.533535Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:d9485be25f9ebf612513b432dca6a78a48d29ff7b8fb73922dffc28c4cf93132","observation_id":"8d25a3c1-cc19-4567-a9b9-fb99a4f20347","resolution":{"observed_at":"2026-08-11T01:04:02.075418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:02.021059Z","title":"What can VLMs do for zero-shot embodied task planning? In ICML 2024 Workshop on LLMs and Cognition , 2024","venue":null,"work_id":"9a588b8c-5816-4f48-ae24-4b5d95334a06","year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.540953Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:ff8eb8e38d913eb36fea6a5135e4c1490e474c235b865cf1a09d4e628e98e279","observation_id":"cf590dee-02c1-45e6-80ce-e2caa7310f03","resolution":{"observed_at":"2026-08-11T01:04:02.038121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T01:04:00.547361Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.547361Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:6dcc47f130ee773cebeda52aed91d63a1caa822a3e4359b2ae28dc3b834aa3f9","observation_id":"2fef787f-f3b7-4cc9-b564-136d50c348cf","resolution":{"observed_at":"2026-08-11T01:04:00.547361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:00.555358Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.555358Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:2955948d24d8380e15b11c50e8332d3ee924a651cb05684d3ce22c1ceb592187","observation_id":"2a057600-aee0-43cd-aabc-e2ed182e82ea","resolution":{"observed_at":"2026-08-11T01:04:00.555358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.964648Z","title":"Sig- moid loss for language image pre-training","venue":null,"work_id":"fe2b66fc-a369-4043-ba2f-62245e34fe14","year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.563882Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:124388b6581afa55bdf13be08bb6d7874d5ba0e72dedf0f29bbd360580b7a01e","observation_id":"74fb2fdd-49a9-4c36-b160-f9baa2d2b086","resolution":{"observed_at":"2026-08-11T01:04:01.974940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-11T03:31:28.001151Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-11T01:04:00.577136Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.577136Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:a863d5376ca8263a192d1df4f6800f51688666fa708c3be8b2795e3c11eb5554","observation_id":"e70968f1-08fb-4f95-9d73-b04acc9a92c0","resolution":{"observed_at":"2026-08-11T01:04:00.577136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.921654Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"d45ffedb-965c-4955-9de6-01c26ec76a7f","year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.582477Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:758c8b04a303449e112a072288031cdcab1e9c0d4cd99cf2ae58bf836abfb69c","observation_id":"3c60e1f1-274a-4bfa-914c-0e559bffa61d","resolution":{"observed_at":"2026-08-11T01:04:01.935040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.891699Z","title":"Teaching matters: Investigating the role of supervision in vision transformers","venue":null,"work_id":"391cb31e-979b-4bd5-833a-0cdcc9e34618","year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.592166Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:c297f7aff3137807e66bd2473d493045f0ade8fe699b7384884b414ebf1fee6c","observation_id":"653fdad4-a124-4cb3-b982-d97938d745f8","resolution":{"observed_at":"2026-08-11T01:04:01.899169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-09T10:52:28.294442Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T01:04:00.604755Z","title":"What do vision trans- formers learn? a visual exploration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.604755Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:3ebd2e0a7731b670f673b8f14df5185f0aecdc8e093962527aa3e0d4764cae65","observation_id":"af3d2fe9-75c3-4303-b35a-1ba8b32c0ed8","resolution":{"observed_at":"2026-08-11T01:04:00.604755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13800","last_updated":"2024-11-14T23:53:05Z","snapshot_observed_at":"2026-08-10T12:32:54.282745Z","submitted_at":"2024-05-22T16:25:03Z","title":"Dense Connector for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13800","snapshot_observed_at":"2026-08-11T01:04:00.610965Z","title":"Dense connector for mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.610965Z"},"links":{"cited_paper":"/paper/2405.13800","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:1e3244d26b5bef1608800912f327e3ae97d309ad4ab1a806d5e6f1e66e049008","observation_id":"90f23e13-0e69-404d-b768-e6734529e72e","resolution":{"observed_at":"2026-08-11T01:04:00.610965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11829","last_updated":"2024-10-15T17:55:22Z","snapshot_observed_at":"2026-08-11T01:23:42.866944Z","submitted_at":"2024-10-15T17:55:22Z","title":"MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11829","snapshot_observed_at":"2026-08-11T01:04:00.618591Z","title":"Mmfuser: Multimodal multi-layer feature fuser for fine- grained vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.618591Z"},"links":{"cited_paper":"/paper/2410.11829","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:6a84eb00da3695857262d394b307d1873dd89f1365e0a9a1f8280b5d7805fdc6","observation_id":"8246b6d9-140e-4581-9051-2b84db952a05","resolution":{"observed_at":"2026-08-11T01:04:00.618591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12709","last_updated":"2024-07-17T16:31:38Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T16:31:38Z","title":"MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12709","snapshot_observed_at":"2026-08-11T01:04:00.624001Z","title":"Mome: Mixture of multimodal experts for generalist multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.624001Z"},"links":{"cited_paper":"/paper/2407.12709","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:d740b049b8796aca7ab83a1aca35a6af5dcc3a1c272d97ed2fc2897f9b84436f","observation_id":"4631b653-1938-4e6c-b03f-3a27ec22ea07","resolution":{"observed_at":"2026-08-11T01:04:00.624001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13046","last_updated":"2024-10-31T17:39:34Z","snapshot_observed_at":"2026-08-05T02:05:40.291312Z","submitted_at":"2024-04-19T17:59:48Z","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13046","snapshot_observed_at":"2026-08-11T01:04:00.630940Z","title":"Mova: Adapting mixture of vision experts to multimodal context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.630940Z"},"links":{"cited_paper":"/paper/2404.13046","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:a288863bc46660ab5138185d46938682832759ed6852ca179558e8b7691a9e62","observation_id":"898b8b5a-0402-4615-9ee9-2154ab66256a","resolution":{"observed_at":"2026-08-11T01:04:00.630940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T01:04:00.637401Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.637401Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:90ba011809bfdbdb08a98bd6e8d1789bc54a191f481a9f8ccde3ecb1d45a554b","observation_id":"f3580f57-c49a-4d0c-a359-49cfc8d51145","resolution":{"observed_at":"2026-08-11T01:04:00.637401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.861729Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"785dd259-58af-4168-8b3b-958b64fca929","year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.644690Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:24d38a7e792474ce542a7714597d118cf0b3702bfabe61891f035ed96a888568","observation_id":"d7d7f11d-e134-46bf-b1f3-369914cb3555","resolution":{"observed_at":"2026-08-11T01:04:01.873148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-08-06T20:48:41.058327Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-08-11T01:04:00.652869Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.652869Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:9c15d05f1efc83b04368c1529155391fb8923ade2ca5185d367e3ce655d31b28","observation_id":"416e3d2c-97ea-48a3-b3b1-1155cfbbbe3c","resolution":{"observed_at":"2026-08-11T01:04:00.652869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-11T01:04:00.661476Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.661476Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:cb417ba88f6f52ccc1c07f42446c24a5a328e7253865b856360f01d5bfa6148f","observation_id":"b02f5a5f-4c2b-4d89-96db-5a0f22b816c8","resolution":{"observed_at":"2026-08-11T01:04:00.661476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T01:04:00.669269Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.669269Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:550cd927683bd1eaf810d052510147810795b2b15cbf219a2bb12316562ae449","observation_id":"7b31f994-3db9-4df9-8637-ec7370a7d065","resolution":{"observed_at":"2026-08-11T01:04:00.669269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.830781Z","title":"Gqa: A new dataset for real- world visual reasoning and compositional question answering","venue":null,"work_id":"6c62bbd2-7487-4aa2-891d-e4d9508c3c60","year":2019},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.675932Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:acd47794fb7fa0e2636e122a57c27b3aa16085c57f65e8dc6d19b19f9ccdba34","observation_id":"bdfdb95f-bec3-4c6a-ae64-c86047a500fd","resolution":{"observed_at":"2026-08-11T01:04:01.839319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.802499Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":"760fa811-2483-44f0-9c38-c08cd582df39","year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.681358Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:9c89a4af58aa7c49032edd9eb26514ff9efbbf34b4d1b9ffce43c73442ce1cf3","observation_id":"33bbe69a-0068-40b3-8dc3-4d50962adb11","resolution":{"observed_at":"2026-08-11T01:04:01.810997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:00.690938Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.690938Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:1f2e8628c9ec8d902416e9e6b96043ccf20c077ea1980199e3cf4149bdbf3bfa","observation_id":"2ff97242-887e-4944-a538-9141a8ab09a1","resolution":{"observed_at":"2026-08-11T01:04:00.690938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T01:04:00.695885Z","title":"Math- vista: Evaluating mathematical reasoning of foundation models in visual con- texts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.695885Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:9e5409610b0e45d417a39011705d77d6ba6e5f0382b309aace2f9a69284110ea","observation_id":"06cc2734-d903-4553-956d-dbfcdbbf5371","resolution":{"observed_at":"2026-08-11T01:04:00.695885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:00.703130Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.703130Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:fa3ac4f4a47c051d40913b23d5be331508403bdf8419ee4dd3dda153f626152f","observation_id":"29ab807f-1c88-4b7d-a8ea-0832ef65912c","resolution":{"observed_at":"2026-08-11T01:04:00.703130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.726397Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"bcae71bd-5a42-475f-96d9-47f4e9685f04","year":2016},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.709191Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:a33446bfbfeea8ea63b50aa9f68916f32ef9515daeba38976a6e02e44a0b7341","observation_id":"0efc949a-7bae-46ad-8973-be955f65c7d2","resolution":{"observed_at":"2026-08-11T01:04:01.733399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.700306Z","title":"Learn to explain: Mul- timodal reasoning via thought chains for science question answering","venue":null,"work_id":"7ab6459a-ca00-424a-92ec-509217ed8b06","year":2022},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.716041Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:15eb565c63cf425eff03d92dcb54fd55266e1e8543a3999d09f170e2aa43c697","observation_id":"a46e26cb-fe04-4b59-869d-dffdb9d6281a","resolution":{"observed_at":"2026-08-11T01:04:01.710494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T01:04:00.727677Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.727677Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:525ceee05d33f89f79cfacaa2ace6e0bbd069b5a68b6dc3c8694efb1194cfad8","observation_id":"1fbbf652-46d6-4fd8-b1d8-d0fa655c23b0","resolution":{"observed_at":"2026-08-11T01:04:00.727677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:00.735323Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.735323Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:071adc66fe6b614e98c38c0c56b882de4a611db151fbc5a873b94ee33221ecb4","observation_id":"653df0b8-edd1-4d60-9a2d-b005808c9712","resolution":{"observed_at":"2026-08-11T01:04:00.735323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T01:04:00.742679Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.742679Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:f76b91081158649fd5caf5367a22343632e09c4e009176594a2b807518b6f526","observation_id":"ef3bfa21-e413-4e3e-8aea-086b37dfa983","resolution":{"observed_at":"2026-08-11T01:04:00.742679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:00.749770Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.749770Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:7410b0e351f1985bc7d9e6a73e402890fc57e7bdcea8753abff13882cfed8a90","observation_id":"75b86e8a-8257-437f-a287-5cc42410321a","resolution":{"observed_at":"2026-08-11T01:04:00.749770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:00.756337Z","title":"Grok-1.5 vision preview","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.756337Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:0701b57902613f695ec11289e6c35eb5d34aacacf7c513ba5decb16b15bcba22","observation_id":"e9ec0c7f-c951-41dc-82cd-e9054f08ef5b","resolution":{"observed_at":"2026-08-11T01:04:00.756337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-11T01:04:00.764139Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.764139Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:a198887a4e8d897b3a0bb043cc977fbea239f85bd1083d6f56dea71c9237e529","observation_id":"19656f93-4ef4-48a0-ae14-7711b892958c","resolution":{"observed_at":"2026-08-11T01:04:00.764139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.615751Z","title":"Mpnet: Masked 34 and permuted pre-training for language understanding","venue":null,"work_id":"a829d0d9-3707-4165-bfac-fff2c0e00fd6","year":2020},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.771072Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:d57c16798b88a62ea6b35cc49a94908bc26b2bcd61d46694f424c205f37d11cb","observation_id":"bfdaa309-176d-42e2-a61c-75346a002ea2","resolution":{"observed_at":"2026-08-11T01:04:01.623934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.589293Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"08855965-af49-4b7d-abaf-2158bd920249","year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.777993Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:ec1dddac1df84c6556032b2921a9252ac94575102e610cb17eeca6ce8ee316cc","observation_id":"6965958c-569f-4dcd-ac64-8d22f287c9e9","resolution":{"observed_at":"2026-08-11T01:04:01.599632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T01:04:00.783374Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.783374Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:1610eb3c63737bcc3d08ea5a0f4438955fa399f9f13e78bf081d2b21cda3ad3f","observation_id":"ef5fe6bd-c25c-41eb-b6bb-58a347ec8ae2","resolution":{"observed_at":"2026-08-11T01:04:00.783374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.566661Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"5426cd99-828b-4d3e-8de9-d4a7430802fc","year":2018},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.789635Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:0ae38d7f890f2891e57740e2bc68a875da55ae51f7e08a8873807ec045732c2b","observation_id":"2b03c9c9-6175-447d-b0a2-a922ed74190e","resolution":{"observed_at":"2026-08-11T01:04:01.574404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T01:04:00.795831Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.795831Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:9d96daab133f055ad339da03dee842a1f8ddc10febc374189b751dd9b33d3708","observation_id":"237d7dad-4893-422d-b544-c4588fb984f3","resolution":{"observed_at":"2026-08-11T01:04:00.795831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.545146Z","title":"mplug-owl2: Revolutionizing multi-modal large lan- guage model with modality collaboration","venue":null,"work_id":"f72dd5b3-5b18-477c-8bd1-d0631856239a","year":2024},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.801285Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:7ee76d81ce7f4c070cab11bcd7142e134f89e459cfc9ac35c673f0763ad2d466","observation_id":"d5f9fbc8-6894-4604-883a-f29cc4ee3007","resolution":{"observed_at":"2026-08-11T01:04:01.553064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-11T01:04:00.805901Z","title":"Llama-adapter v2: Parameter- efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.805901Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:228dbedf5b94b97e928981aead1694d8909c793209835cfb605bbff7bdbfde5a","observation_id":"08e6b8ce-f8e3-4346-be79-123858363622","resolution":{"observed_at":"2026-08-11T01:04:00.805901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:01.506876Z","title":"Obelics: An open web-scale fil- tered dataset of interleaved image-text documents","venue":null,"work_id":"75f4fc7c-006a-423f-9749-317d9d7d5253","year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.811591Z"},"links":{"citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:ab930096558b529eafe767d3e7921d2e3726e48c10f3f63ffb7cd07a0e761074","observation_id":"9e17f659-684c-4700-acfd-ede212d60078","resolution":{"observed_at":"2026-08-11T01:04:01.516382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T01:04:00.817362Z","title":"Qwen-vl: A versatile vision- language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.817362Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:7f1e7cdeabd2787d907ddcccb0c995e5718f3ebe23fb4e1a7c243f4a956e9bb3","observation_id":"b4dce60f-e2f2-4024-b239-f0c80c3ef830","resolution":{"observed_at":"2026-08-11T01:04:00.817362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T08:27:02.724320Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2501.08443."}