{"as_of":"2026-08-11T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1185b3cb2e8ef273f4af78d039652df7da9783a1bf76bf60abc5025f9558310a","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:59:22.491936Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:07:30.113146Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T17:03:01.237563Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10834","snapshot_observed_at":"2026-08-04T08:07:30.113146Z","title":"and Bianco, S., 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22868","last_updated":"2026-08-01T15:11:14Z","snapshot_observed_at":"2026-08-10T23:47:17.913034Z","submitted_at":"2025-10-26T23:19:28Z","title":"Seeing the Unseen: Towards Training-Free Inspection for Wind Turbine Blades Using Knowledge-Augmented Vision Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T08:07:30.113146Z"},"links":{"cited_paper":"/paper/2501.10834","citing_paper":"/paper/2510.22868"},"observation_digest":"sha256:69e2c506bbec193a5b124d972f7f49356713602a0e0c0bd273e3125ae123dc1f","observation_id":"6357fed2-cb16-462c-bb6a-e72e161a95d0","resolution":{"observed_at":"2026-08-04T08:07:30.113146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"cited_work":{"arxiv_id":"2501.10834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10834","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.10834 (2025)","venue":null,"work_id":"9faf78ec-a531-48e5-ad44-3f5407624e77","year":2025},"citing_paper":{"arxiv_id":"2604.03833","last_updated":"2026-04-04T19:19:33Z","snapshot_observed_at":"2026-08-11T12:26:53.667429Z","submitted_at":"2026-04-04T19:19:33Z","title":"SPARK-IL: Spectral Retrieval-Augmented RAG for Knowledge-driven Deepfake Detection via Incremental Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T17:02:08.798342Z"},"links":{"cited_paper":"/paper/2501.10834","citing_paper":"/paper/2604.03833"},"observation_digest":"sha256:6facf27b99cd715ceec88375c2e3eea1497b15b2c3b28e719602dcc8e432d787","observation_id":"188c0221-fc41-4d67-aec8-88065a578630","resolution":{"observed_at":"2026-05-13T17:03:01.239049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.10834/citation-record","integrity":"/paper/2501.10834/integrity","json":"/paper/2501.10834/citation-record.json","paper":"/paper/2501.10834"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T18:59:22.269743Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.269743Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:d89416846ce12b1844297a75b061bbe773886880268d937f0a128c148a2e13a7","observation_id":"8cc6c247-1757-4158-8158-1f4096d1717b","resolution":{"observed_at":"2026-08-10T18:59:22.269743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05856","last_updated":"2024-01-11T12:04:11Z","snapshot_observed_at":"2026-08-10T09:53:09.889548Z","submitted_at":"2024-01-11T12:04:11Z","title":"Seven Failure Points When Engineering a Retrieval Augmented Generation System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05856","snapshot_observed_at":"2026-08-10T18:59:22.276228Z","title":"Barnett, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.276228Z"},"links":{"cited_paper":"/paper/2401.05856","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:8592c95bedc7992f443d6f0e3feeb18e142c4c377a4a9dc87c5a082fdaa5debf","observation_id":"a0fb9891-a3eb-4e34-961e-58ba32199b34","resolution":{"observed_at":"2026-08-10T18:59:22.276228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.164430Z","title":"Beery, G","venue":null,"work_id":"a4fb57b6-e334-42ac-b4b2-80ca3cb75591","year":2018},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.282760Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:64aefaa87a18919c0b5b24fdbeb39656dd3e4f41a3850a70ce7205c2f2e3144b","observation_id":"aab9b469-a916-4d49-9709-0d89f75005da","resolution":{"observed_at":"2026-08-10T18:59:23.168998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.288188Z","title":"Brown, B","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.288188Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:271b52295302fb5dc80eb691c88281cea33263908906b1d1fe377889aa6f1d02","observation_id":"d355aea3-a561-46b3-824d-f2e2687c5811","resolution":{"observed_at":"2026-08-10T18:59:22.288188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-10T18:59:22.293710Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.293710Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:e08a25ee6b66938f320b97ead778e92c05390ab4cf430b865cba02b4c5047900","observation_id":"af1f8924-905b-453f-8c48-bc293817c2ed","resolution":{"observed_at":"2026-08-10T18:59:22.293710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1311.3618","last_updated":"2013-11-15T16:14:12Z","snapshot_observed_at":"2026-07-06T03:28:12.821058Z","submitted_at":"2013-11-14T19:28:35Z","title":"Describing Textures in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1311.3618","snapshot_observed_at":"2026-08-10T18:59:22.299975Z","title":"Cimpoi, S","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.299975Z"},"links":{"cited_paper":"/paper/1311.3618","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:89a60c1af84148d839353e3c1071b2f247b0eb705dd9f9598290e03b8e3b3e0c","observation_id":"4a5122be-9685-4d68-a5bd-093bbafe94e1","resolution":{"observed_at":"2026-08-10T18:59:22.299975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-10T18:59:22.307226Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.307226Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:a3d9e8bb7b1c97e423a998c580f031bb99be6d8f06bbe15a31d051e12c027db9","observation_id":"568430ab-122e-450f-8111-17889571633d","resolution":{"observed_at":"2026-08-10T18:59:22.307226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-10T18:59:22.313728Z","title":"Douze, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.313728Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:08601c461eefdf174798633a78b27e7db2cbe3b1f92193ba8aa0f4b246720cc8","observation_id":"2014e0b0-99e8-4fe4-9c6e-2176ec45369c","resolution":{"observed_at":"2026-08-10T18:59:22.313728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-10T18:59:22.319238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.319238Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:b9e265617ed3e0b5ea330bb3f9256679743161f6a68694331b71751f6c6edcb6","observation_id":"38860a84-a34c-4cd6-9d80-ac34c38cf331","resolution":{"observed_at":"2026-08-10T18:59:22.319238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-10T18:59:22.325335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.325335Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:dab83444cf9710a58e15fce6598274b21c3cd70d8d282df8a22e533a4e538afe","observation_id":"755370d3-43a8-4d1a-98e7-c50d29c99622","resolution":{"observed_at":"2026-08-10T18:59:22.325335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05904","last_updated":"2024-10-01T12:08:23Z","snapshot_observed_at":"2026-08-06T03:54:33.263934Z","submitted_at":"2024-05-09T17:00:22Z","title":"Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05904","snapshot_observed_at":"2026-08-10T18:59:22.330426Z","title":"Gekhman, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.330426Z"},"links":{"cited_paper":"/paper/2405.05904","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:e37940f7f2ac166d4c261f2cd1e98834bd357714dad93bd5f338ce0f5bd06722","observation_id":"cdc80ffe-d3e7-406c-9b49-22f2d8d9ab80","resolution":{"observed_at":"2026-08-10T18:59:22.330426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07326","last_updated":"2022-11-06T08:45:40Z","snapshot_observed_at":"2026-07-06T13:52:39.607638Z","submitted_at":"2022-09-15T14:36:17Z","title":"A Continual Development Methodology for Large-scale Multitask Dynamic ML Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07326","snapshot_observed_at":"2026-08-10T18:59:22.336308Z","title":"Gesmundo","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.336308Z"},"links":{"cited_paper":"/paper/2209.07326","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:d34320b8979555642676383b1a9819b800f6a94d2a1f38dcc9adbc9c4e97104c","observation_id":"10f6fb59-535a-438c-9272-2baac4694326","resolution":{"observed_at":"2026-08-10T18:59:22.336308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07424","last_updated":"2024-02-25T08:10:18Z","snapshot_observed_at":"2026-07-06T17:00:33.386675Z","submitted_at":"2023-12-12T16:48:07Z","title":"How Well Does GPT-4V(ision) Adapt to Distribution Shifts? A Preliminary Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07424","snapshot_observed_at":"2026-08-10T18:59:22.341479Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.341479Z"},"links":{"cited_paper":"/paper/2312.07424","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:526d64ef8d1a2bade51bd3e9fbd417716b13c2b517ea9932134677033b7916b6","observation_id":"878b5f7d-fbef-4806-bc6c-5fe47eb63fff","resolution":{"observed_at":"2026-08-10T18:59:22.341479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.346081Z","title":"Helber, B","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.346081Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:6f99bd7dc00eab70154e4b9365e9c2d74df3e46822b57a8f6097758da9999d89","observation_id":"4be7e8fb-bfc2-491a-81e5-6177141e93c7","resolution":{"observed_at":"2026-08-10T18:59:22.346081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.129612Z","title":"Irvin, P","venue":null,"work_id":"7f63b8ef-c3c7-4ba6-aa66-291de9b9e61d","year":2019},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.350153Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:a972dd83ede76ef38205b6164f5e3f54f21868d350074964779d166ff3ac0ae9","observation_id":"2406fd7c-05a7-437b-a4e3-8e1aa567c1a7","resolution":{"observed_at":"2026-08-10T18:59:23.134498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03299","last_updated":"2022-11-16T16:38:18Z","snapshot_observed_at":"2026-08-05T00:57:17.859949Z","submitted_at":"2022-08-05T17:39:22Z","title":"Atlas: Few-shot Learning with Retrieval Augmented Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03299","snapshot_observed_at":"2026-08-10T18:59:22.354342Z","title":"Izacard, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.354342Z"},"links":{"cited_paper":"/paper/2208.03299","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:2060f1a5cac3d09c47587e52d1ee06dac4aa3ad57f27ce5e33ffa04d9e810bd2","observation_id":"8c3d950b-5959-47d7-895c-7fcbb00259ee","resolution":{"observed_at":"2026-08-10T18:59:22.354342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.114695Z","title":"Jiang, J","venue":null,"work_id":"14368302-03c9-4fb4-9b29-2d2493a0ec60","year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.358630Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:b73eed48d53e4a374b0efce91be6b7fa228836634a5d5e35ee2f8b3f4ac5824b","observation_id":"90c0a84a-eb42-4456-b818-2baea7d779da","resolution":{"observed_at":"2026-08-10T18:59:23.119462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.097767Z","title":null,"venue":null,"work_id":"50c1f563-f57f-43c0-8c15-7cdf9c5956da","year":2022},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.367221Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:2a11b7f11b7e5622abf8d4b9c3cd89939823cefa4df442da72b6aac5c6b7a6ec","observation_id":"2649e664-190a-4b99-9697-ae796a5695b7","resolution":{"observed_at":"2026-08-10T18:59:23.103237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10169","last_updated":"2023-07-19T17:55:13Z","snapshot_observed_at":"2026-08-10T14:34:24.189939Z","submitted_at":"2023-07-19T17:55:13Z","title":"Challenges and Applications of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10169","snapshot_observed_at":"2026-08-10T18:59:22.371739Z","title":"Kaddour, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.371739Z"},"links":{"cited_paper":"/paper/2307.10169","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:8635a429ebe8180ea819ca43902c241f5f9362478db9375eb30f0bf89b2e7651","observation_id":"7aa57557-9698-4164-bef9-9e4ead33e8ce","resolution":{"observed_at":"2026-08-10T18:59:22.371739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.082122Z","title":null,"venue":null,"work_id":"7ed6dab0-6f57-48d7-a76b-dbc1e7c25846","year":2022},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.376119Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:93f852ed3cd6f421620727367469e6834a280ebfaa87e74db342b5619a33e70d","observation_id":"83712999-5c27-4828-895d-c7063830d2da","resolution":{"observed_at":"2026-08-10T18:59:23.086780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.065838Z","title":"Lewis, E","venue":null,"work_id":"d8aba9d2-7095-4f20-82fd-0d6f4402affe","year":2020},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.381356Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:f63ae0236bb614b1e019bc8d982d05f427d65eb3df1e9eee40b020db8e3af11d","observation_id":"06364b85-16e0-4001-92c9-90b3672b29e8","resolution":{"observed_at":"2026-08-10T18:59:23.071056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.050489Z","title":null,"venue":null,"work_id":"8bb85a4f-7f85-469f-b5bd-665c56996cdc","year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.385732Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:abb840951af53332f7406cf00f602cb4b50aa807ae6294901ebcb2dfe335884a","observation_id":"51c2f389-ba5c-45e2-9892-f62c5f1d5bdc","resolution":{"observed_at":"2026-08-10T18:59:23.055449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.035316Z","title":null,"venue":null,"work_id":"897e1385-d099-47ff-9a64-e7752074e9ad","year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.391260Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:c822439203c267a7424567e4706e67507a1ddf7b089855776edf361b212e8b06","observation_id":"128f9d1c-fba5-4a0e-a70d-63fe7cb728a1","resolution":{"observed_at":"2026-08-10T18:59:23.039771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.019142Z","title":"Nguyen, T","venue":null,"work_id":"8c7ef3c4-e5c4-4007-91a1-6af54d97a6cb","year":2022},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.402049Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:c56a620d7af57f6213f8fc05bbd3bef8501688493d99ae7d36d82bfd253384cf","observation_id":"ee9b6648-2851-4ed9-bb96-d181b21eb8b3","resolution":{"observed_at":"2026-08-10T18:59:23.024658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:23.004227Z","title":"Ortiz-Jimenez, A","venue":null,"work_id":"a789be7e-4fdb-4274-9d82-d83984b9411c","year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.406705Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:a2c25300890b7a563fd441222bd1c5a628ff5f8905159144f740c3a8b0b5d8e0","observation_id":"866393ae-e8e7-4e37-9076-ee9d89a2fac5","resolution":{"observed_at":"2026-08-10T18:59:23.008920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.411933Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.411933Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:907ff7f8df66b672483db1908a9fb4333019c29fe63e0cb26b4352d98b0c403a","observation_id":"aff82a76-07b7-4c16-9cf2-c2b939b4c83d","resolution":{"observed_at":"2026-08-10T18:59:22.411933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.979333Z","title":"Radford, J","venue":null,"work_id":"a058bda9-1f29-4935-a24d-73dd7187b79a","year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.416511Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:aa5bbec6fd4d44ffb0a872bdf57fb4ee95daf57649f9ef55abaa087477464ec9","observation_id":"da3c2a30-1b58-4e10-ae7c-7b76a5247812","resolution":{"observed_at":"2026-08-10T18:59:22.983805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.963401Z","title":"Silva-Rodriguez, H","venue":null,"work_id":"31de5d18-0fc1-45a5-87ab-34c5fbc08ffc","year":2025},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.427687Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:3ed79ee6973571e819250ea9000195352ca5186b4655447cc0180abe70dbdbe6","observation_id":"b4d1da23-5809-4ce5-8f39-16d49a141781","resolution":{"observed_at":"2026-08-10T18:59:22.968030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T18:59:22.432908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.432908Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:33e6592b04514d8ab18650b612479f2c8613a916bfa30318298fb1ec77da3669","observation_id":"8f8beeeb-ddde-44b0-acf4-062dabdda868","resolution":{"observed_at":"2026-08-10T18:59:22.432908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.947195Z","title":"Tschandl, C","venue":null,"work_id":"4c0e66f7-e51f-4e35-a9c6-f08ab45df189","year":2018},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.437699Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:373c8f066be91760d9f4173c5e9bf8c8e6665a320a5c2f7c14e6d72f10560c5b","observation_id":"6ff4640c-aa9f-48fa-842d-61ce357fd409","resolution":{"observed_at":"2026-08-10T18:59:22.953120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.930473Z","title":null,"venue":null,"work_id":"d59775c5-ea3b-4c09-8c9c-1f8516fc5b94","year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.442876Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:dad2f536733dd8fef269315710c79772e2f5f2d19ce69ec8595317ec0f742622","observation_id":"8bfb78a1-a42f-411e-ba62-697bdec6ed79","resolution":{"observed_at":"2026-08-10T18:59:22.936220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.914458Z","title":null,"venue":null,"work_id":"d002b6cb-82da-47a7-8fbd-3d971761c893","year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.447237Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:f0c629d436cd4fc9e89b32f4ad54849412d76ec003226d29f71046a7adf0388e","observation_id":"66da3bb4-e596-40e2-9698-8db509a4e6ea","resolution":{"observed_at":"2026-08-10T18:59:22.919874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-10T18:59:22.456916Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.456916Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:17dbdcae8a8a89489d2ad1359655f08da36e5f739c0f6a860103e4aee147f423","observation_id":"dbde62b8-2068-4c03-a474-6e15080f5c59","resolution":{"observed_at":"2026-08-10T18:59:22.456916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.897653Z","title":null,"venue":null,"work_id":"72623995-3652-4f75-9ae8-a980400e00d9","year":2023},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.461498Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:2d0d18f53ba2ced910e9830748277282d01618a8e751a5bc363865a62aa7fc26","observation_id":"59cbaa03-ccb1-45d9-a8ef-62d3f84cd4a6","resolution":{"observed_at":"2026-08-10T18:59:22.902470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.466041Z","title":"Yang and S","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.466041Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:ebc506e64ba957ee7e788b37c4ff231896661959daa44f9b4f73d6985b71624e","observation_id":"14f0035a-4d33-485f-9aa4-8f35b7e6ff2e","resolution":{"observed_at":"2026-08-10T18:59:22.466041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.871823Z","title":null,"venue":null,"work_id":"ab10dd01-30c4-4c96-9ffe-5cd75c8e141e","year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.470532Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:7755ceecc1610d8b760f8aa5e93f87270a3c3c245ddc6672da516b52cbc46375","observation_id":"c259c935-6dd4-47cc-9345-2f8f1741199c","resolution":{"observed_at":"2026-08-10T18:59:22.877434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-10T21:32:36.140961Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-10T18:59:22.478782Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.478782Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:9e4f239b0bc6759fffb0ec1e26af5fa24687b3e9f7fc0671e659f73b4f94cf03","observation_id":"e9632098-2d8d-4b51-bdac-4de454430426","resolution":{"observed_at":"2026-08-10T18:59:22.478782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06599","last_updated":"2024-02-09T18:21:51Z","snapshot_observed_at":"2026-07-06T17:28:06.332906Z","submitted_at":"2024-02-09T18:21:51Z","title":"On the Out-Of-Distribution Generalization of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06599","snapshot_observed_at":"2026-08-10T18:59:22.482907Z","title":"Zhang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.482907Z"},"links":{"cited_paper":"/paper/2402.06599","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:9a2550f5207e1a64a540462a75819e51ff1fc430cfdd33482420e9fb011678e4","observation_id":"cb701db6-e687-4528-a04e-e786a440bf23","resolution":{"observed_at":"2026-08-10T18:59:22.482907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10008","last_updated":"2023-10-16T02:05:03Z","snapshot_observed_at":"2026-08-09T21:18:59.215897Z","submitted_at":"2023-10-16T02:05:03Z","title":"Towards Unified and Effective Domain Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10008","snapshot_observed_at":"2026-08-10T18:59:22.487449Z","title":"Zhang, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.487449Z"},"links":{"cited_paper":"/paper/2310.10008","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:7eee3ebadd675c79416f5748a63f011a476b7edb07b92e9e8574b40a37d427c9","observation_id":"8b895342-438d-4f24-a4d4-b4d086f17d08","resolution":{"observed_at":"2026-08-10T18:59:22.487449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:59:22.474598Z","title":"doi: 10.1093/nsr/nwae403","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.474598Z"},"links":{"citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:3c5bc7bbef2a8798021287d94d7823cf65a9f52aa917616a21abb8893dd32707","observation_id":"0b58d6aa-7096-4d4a-a693-0af5915543a4","resolution":{"observed_at":"2026-08-10T18:59:22.474598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-10T18:59:22.491936Z","title":"\" for demo in demo_examples: prompt += f","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.491936Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:707c9f5d4ae52259d0bcb855c8a531bb36c2015105c0e37a1d4922c3740e724d","observation_id":"cf469f36-f706-4221-91a1-650c164080a7","resolution":{"observed_at":"2026-08-10T18:59:22.491936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-10T18:59:22.421868Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.421868Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:e5f56cfe4da1dd03913426a6b7c8475e088ccd7619e8e63af61a66c182781d2a","observation_id":"de00d85b-7f45-4740-9543-dfcb5b4893ba","resolution":{"observed_at":"2026-08-10T18:59:22.421868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-10T18:59:22.396602Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.396602Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:f85a08b52bde05cab12bcb72a60550fc20e2bae03fcee72e852baefc1b54aa18","observation_id":"c3036f67-beb2-4eeb-985a-2b6a404395dd","resolution":{"observed_at":"2026-08-10T18:59:22.396602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-10T18:59:22.362716Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.362716Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:557644e1a6169ba9a83a98e968f8e4d4b6dd729935a1920fe3276d3c11f2109a","observation_id":"9b2465b4-c836-4a5e-9a6b-bb7a62a0222d","resolution":{"observed_at":"2026-08-10T18:59:22.362716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:35:06.953450Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2501.10834."}