{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:755d9310b2a586dff732231818e24a29c67d1714821159eb282cf32ee86b0e81","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:53.793245Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T14:16:53.793245Z","title":"A survey of multimodal retrieval- augmented generation.arXiv preprint arXiv:2504.08748, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:53.793245Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:57b19161086dd75c8b982f213a9553956228df54f96810b270b7bf914052b799","observation_id":"fd11a890-692d-48c2-8917-d8f7d020f9f6","resolution":{"observed_at":"2026-08-07T14:16:53.793245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2505.22095","last_updated":"2026-04-06T12:52:40Z","snapshot_observed_at":"2026-08-02T15:44:17.473900Z","submitted_at":"2025-05-28T08:17:57Z","title":"Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T13:50:30.090068Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.22095"},"observation_digest":"sha256:19a1db9661359894c616d144675a03845c87372453980546284b6be93e686115","observation_id":"2be64108-7341-4319-82ad-26b9babc0484","resolution":{"observed_at":"2026-05-19T13:52:19.911032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T12:42:25.485699Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24073","last_updated":"2025-08-26T16:42:37Z","snapshot_observed_at":"2026-08-07T21:48:31.035838Z","submitted_at":"2025-05-29T23:32:03Z","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:42:25.485699Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2505.24073"},"observation_digest":"sha256:3f210b86dff2db0d4c6fca26af611502a7ee1ef2c3708581881f4673cd67ad90","observation_id":"8277179e-947e-474e-9d71-f8f8c542bb2c","resolution":{"observed_at":"2026-08-07T12:42:25.485699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T12:09:35.030118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02037","last_updated":"2025-09-01T10:49:18Z","snapshot_observed_at":"2026-08-08T09:28:42.352039Z","submitted_at":"2025-05-31T03:50:19Z","title":"FinS-Pilot: A Benchmark for Online Financial RAG System","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:35.030118Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2506.02037"},"observation_digest":"sha256:04d69fe9aeaa82f03a3f190518a8132004fd59db2b3c8c74db7756dd9d54593e","observation_id":"2291e17b-ceb8-4b2a-9ff8-f079b11ede24","resolution":{"observed_at":"2026-08-07T12:09:35.030118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-07T10:19:19.431632Z","title":"A survey of multimodal retrieval- augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05766","last_updated":"2025-06-06T05:48:22Z","snapshot_observed_at":"2026-08-07T20:58:18.248298Z","submitted_at":"2025-06-06T05:48:22Z","title":"BioMol-MQA: A Multi-Modal Question Answering Dataset For LLM Reasoning Over Bio-Molecular Interactions","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:19.431632Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2506.05766"},"observation_digest":"sha256:603c10e721c045cf493105344cba87a72bcefcb825ece10f1d07d8e2f465b938","observation_id":"93663203-679f-4c4a-8523-67eca9437942","resolution":{"observed_at":"2026-08-07T10:19:19.431632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-06T13:20:35.866564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20804","last_updated":"2026-07-18T05:33:43Z","snapshot_observed_at":"2026-08-10T11:19:36.443190Z","submitted_at":"2025-07-28T13:16:23Z","title":"MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:20:35.866564Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2507.20804"},"observation_digest":"sha256:4e5c5baf116bcc7eaab61a491d082e5aefa9fc826ee83318313f20e9fa1e745d","observation_id":"e63c4cbd-17db-4e25-b0e9-3078d9b98304","resolution":{"observed_at":"2026-08-06T13:20:35.866564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T22:51:59.142513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:59.142513Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:5aef4f3a57c941fbcd8a25d4955c6c3c9c4eb461d6b48e29b40a8ab7192878e5","observation_id":"7f2d4f58-ed45-42a5-8180-7b25e43619f3","resolution":{"observed_at":"2026-08-05T22:51:59.142513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2510.15253","last_updated":"2026-04-20T08:38:26Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-17T02:33:16Z","title":"Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T06:54:03.390655Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2510.15253"},"observation_digest":"sha256:5672e83df9af3beac0b562a5284a3809bb37886354d2f37843e4650691efe507","observation_id":"6b316e97-048c-493f-bad3-124a33b89700","resolution":{"observed_at":"2026-05-18T06:56:01.613677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T09:36:21.184692Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2601.04720"},"observation_digest":"sha256:aacef10dd5462ac4fa8a3acf5d5bc5e8a523fd038043a049f6015e39edcc2a1e","observation_id":"8128c3f8-76fc-4c91-bb41-a444e2851d80","resolution":{"observed_at":"2026-05-12T09:36:21.318739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2602.19549","last_updated":"2026-04-20T01:43:08Z","snapshot_observed_at":"2026-07-06T22:46:45.213871Z","submitted_at":"2026-02-23T06:45:19Z","title":"Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:06.005832Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2602.19549"},"observation_digest":"sha256:eba36b021745f9c1d3eb2fe0744d498f7bbcef4dcda2a72b9f7f8a495372e492","observation_id":"8945ed12-3d25-4a66-88ab-68ef2bc0f9c5","resolution":{"observed_at":"2026-05-15T20:56:37.033893Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-03T03:30:18.930328Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29897","last_updated":"2026-05-24T03:07:49Z","snapshot_observed_at":"2026-08-07T14:16:57.757482Z","submitted_at":"2026-02-08T12:39:19Z","title":"UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:18.930328Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2603.29897"},"observation_digest":"sha256:cd742265c5c1e65f96f2984a2c872393df602bfa25f18118f64e079d705f41e9","observation_id":"6a31d743-c9d5-4e60-9e78-34b2649db88f","resolution":{"observed_at":"2026-08-03T03:30:18.930328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.07784","last_updated":"2026-04-09T04:22:18Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:22:18Z","title":"Automotive Engineering-Centric Agentic AI Workflow Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:32:09.896596Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.07784"},"observation_digest":"sha256:ae8b8daff832c88984cb9ebe484abdfe3df21f6de7ff2b8d86976a474cf56e7b","observation_id":"d74c94ea-8047-4054-9ed0-9aefff2d53dc","resolution":{"observed_at":"2026-05-11T06:41:01.226204Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.12735","last_updated":"2026-08-05T08:52:46Z","snapshot_observed_at":"2026-08-09T03:20:26.673676Z","submitted_at":"2026-04-14T13:49:19Z","title":"AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T15:21:42.285340Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.12735"},"observation_digest":"sha256:b70558c6f055261bf8737f9bb765b844a9a341edd24596fdb3b64adf2748d9e6","observation_id":"ccccbf5e-fb25-4bc9-839c-bf4d327599ba","resolution":{"observed_at":"2026-05-11T10:41:05.717876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.12890","last_updated":"2026-04-25T02:32:57Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:40:28Z","title":"Towards Long-horizon Agentic Multimodal Search","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:40:32.137708Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.12890"},"observation_digest":"sha256:c77cade8e0f0aa15563c462d7f3435d1b0e089f9c26798b66f07a27976e602c4","observation_id":"dffa2eb4-0b5c-4239-b797-7dbabe59dc9b","resolution":{"observed_at":"2026-05-11T10:01:04.600009Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.24564","last_updated":"2026-04-30T01:34:01Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:51:00Z","title":"MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T03:51:49.033280Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.24564"},"observation_digest":"sha256:078af44b7b2c663995e86302e16ccef96d93aa17e607b5aa10925ae80ae09664","observation_id":"12fd3f85-51bb-48dc-9b77-aa692b8e169f","resolution":{"observed_at":"2026-05-11T21:56:12.234750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2604.27600","last_updated":"2026-04-30T08:50:03Z","snapshot_observed_at":"2026-07-06T23:13:02.921765Z","submitted_at":"2026-04-30T08:50:03Z","title":"Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T07:19:44.125479Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2604.27600"},"observation_digest":"sha256:3e01f51c8daeac387e7fedf0794e3fa73369df923d8828c2d9a8dcd05e9f4735","observation_id":"99a10e23-1b13-4993-8d8c-e12b24ed7cc5","resolution":{"observed_at":"2026-05-12T10:11:28.189192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:f98380c88effbd7ad4bd3043010cc39d86dfcd372569c1a451fa8d2a07203f2e","observation_id":"d3c4e3c1-6dcd-408d-8fbd-307c3c60fe3f","resolution":{"observed_at":"2026-05-11T16:01:22.785950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:80bb3d4a20027eb103790dbe039334e335ab9eb5ab4d642f5449422a866ec86f","observation_id":"2e88b10f-7c82-4021-aa6e-8fda353e0bad","resolution":{"observed_at":"2026-05-11T01:50:51.632248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.08421","last_updated":"2026-05-08T19:28:46Z","snapshot_observed_at":"2026-08-03T20:04:29.535256Z","submitted_at":"2026-05-08T19:28:46Z","title":"Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T01:16:05.097254Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.08421"},"observation_digest":"sha256:fd4849c0bc580dc7af3d179491368cd0bfd5c285b0fa95e5e37e6b2600ccb2b5","observation_id":"382471ef-c43d-40df-a880-c829ae399771","resolution":{"observed_at":"2026-05-12T08:06:36.550726Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.10253","last_updated":"2026-05-11T09:22:53Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T09:22:53Z","title":"Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T05:29:41.946357Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.10253"},"observation_digest":"sha256:6b8d74a518b536949fb30930fe9afa90b2bf69c19ed30eedfd0a3ee334fbacb5","observation_id":"22b17097-7bb2-4c17-ab7d-dbbb5b0f797d","resolution":{"observed_at":"2026-05-12T05:31:23.639994Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.11864","last_updated":"2026-05-12T09:45:59Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:45:59Z","title":"Very Efficient Listwise Multimodal Reranking for Long Documents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:19.587925Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.11864"},"observation_digest":"sha256:169f6178a7e8ea1c7f33bdb66c834bf46a3b2085f5a2b3afa62f6a2024d5d24b","observation_id":"a45ee65b-15ef-4008-a266-de4e78c4cb4e","resolution":{"observed_at":"2026-05-13T05:27:19.556692Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.13277","last_updated":"2026-05-13T09:54:31Z","snapshot_observed_at":"2026-07-31T16:56:58.325856Z","submitted_at":"2026-05-13T09:54:31Z","title":"Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-14T19:09:18.975682Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.13277"},"observation_digest":"sha256:01da50ee790ec711decfef2830e0b03241763293091ef15d7707d4c81b6f1a79","observation_id":"ec951658-6e71-4dda-82ef-60d60daa5ef8","resolution":{"observed_at":"2026-05-14T19:09:22.904045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2605.18884","last_updated":"2026-05-16T10:04:48Z","snapshot_observed_at":"2026-08-01T06:16:30.439623Z","submitted_at":"2026-05-16T10:04:48Z","title":"Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T15:55:57.330888Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2605.18884"},"observation_digest":"sha256:c893c573e5ce3d69b0f5802c2b443a806beabdf7cf1c225729ce3d4f7f1d7b34","observation_id":"d14aac79-9764-4d19-9424-6704c4a81a88","resolution":{"observed_at":"2026-05-20T15:58:32.660160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.04231","last_updated":"2026-06-02T21:31:47Z","snapshot_observed_at":"2026-08-02T18:27:50.227511Z","submitted_at":"2026-06-02T21:31:47Z","title":"MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T09:52:28.556039Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.04231"},"observation_digest":"sha256:d69eba88e40f47582e4457b96e34d36fe8d97e903269e534d4ed00366a60fd67","observation_id":"f42ffe12-2138-489f-9dcc-06df3ffe15cf","resolution":{"observed_at":"2026-07-02T03:36:29.830258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.25343","last_updated":"2026-06-26T04:35:35Z","snapshot_observed_at":"2026-08-06T22:43:48.099674Z","submitted_at":"2026-06-24T03:17:30Z","title":"Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:12.242955Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.25343"},"observation_digest":"sha256:899d587db68396df76ddd286a4a0f107c8acbbb90763eb8bfa4fc5eb45dcf8f8","observation_id":"d8d13eb5-b3df-46fc-8ef1-c0b21683634a","resolution":{"observed_at":"2026-07-04T19:30:07.791252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.25343","last_updated":"2026-06-26T04:35:35Z","snapshot_observed_at":"2026-08-06T22:43:48.099674Z","submitted_at":"2026-06-24T03:17:30Z","title":"Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T05:07:28.537679Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.25343"},"observation_digest":"sha256:a7401e65fffdc4274ba4b8442c4a8e961d0246ba9ad4eb19a17762b8b1a060c0","observation_id":"74057d3c-df7d-4041-b855-899528be2e64","resolution":{"observed_at":"2026-06-29T18:23:51.232989Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2606.26458","last_updated":"2026-06-24T23:38:42Z","snapshot_observed_at":"2026-08-02T19:46:19.775072Z","submitted_at":"2026-06-24T23:38:42Z","title":"MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T01:11:45.657964Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2606.26458"},"observation_digest":"sha256:89fcd34d350a830ded24cdb029594b3b6bcdaf821a11da56389e9074c80a16d5","observation_id":"4c728f44-40a2-403e-911f-cd84412a9c4e","resolution":{"observed_at":"2026-06-27T01:10:20.757282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":"2504.08748","doi":"10.48550/arxiv.2504.08748","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nitesh Methani, Pritha Ganguly, Mitesh M Khapra, and Pratyush Kumar","venue":"ArXiv.org","work_id":"a9c65993-6974-435d-8617-ca3d23d5d4dc","year":2025},"citing_paper":{"arxiv_id":"2607.00685","last_updated":"2026-07-01T09:30:10Z","snapshot_observed_at":"2026-08-09T10:39:28.131671Z","submitted_at":"2026-07-01T09:30:10Z","title":"M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-02T03:31:24.102843Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2607.00685"},"observation_digest":"sha256:7948b7962babe2771f28e8500cdbcb5a603ac5c801fc0051b66f511654ee029d","observation_id":"e3df4522-b9cd-41e3-bc35-4414ab61d570","resolution":{"observed_at":"2026-07-02T03:36:29.074287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-01T03:45:20.175586Z","title":"A survey of multimodal retrieval-augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24850","last_updated":"2026-07-25T06:47:46Z","snapshot_observed_at":"2026-08-08T08:58:37.892841Z","submitted_at":"2026-07-25T06:47:46Z","title":"SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T03:45:20.175586Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2607.24850"},"observation_digest":"sha256:62c0dd361ce8f22d61a2f920bae3801bfba1ab42fe114fc2cd95b17e27fb48f2","observation_id":"ecb0fe80-b1b7-4aed-ac52-18b0db7f01f6","resolution":{"observed_at":"2026-08-01T03:45:20.175586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-07-31T03:11:54.590831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28580","last_updated":"2026-07-30T17:40:05Z","snapshot_observed_at":"2026-08-09T19:44:43.857341Z","submitted_at":"2026-07-30T17:40:05Z","title":"DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T03:11:54.590831Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2607.28580"},"observation_digest":"sha256:54915920a8bddecc05bdd90447823096778c75e81635bbe9c083497d31f2fde2","observation_id":"bdaf9895-c1da-4dd6-bef1-35e27fbef9aa","resolution":{"observed_at":"2026-07-31T03:11:54.590831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08748","snapshot_observed_at":"2026-08-06T00:30:31.505780Z","title":"A survey of multimodal retrieval- augmented generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03161","last_updated":"2026-08-04T05:48:05Z","snapshot_observed_at":"2026-08-07T23:10:40.368824Z","submitted_at":"2026-08-04T05:48:05Z","title":"Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:31.505780Z"},"links":{"cited_paper":"/paper/2504.08748","citing_paper":"/paper/2608.03161"},"observation_digest":"sha256:87a912b613f3e02fb18423feea4d5ecf5df6016abd19dfe708b812745b524047","observation_id":"381b2318-a7f7-476b-9142-31892c89e5ca","resolution":{"observed_at":"2026-08-06T00:30:31.505780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.08748/citation-record","integrity":"/paper/2504.08748/integrity","json":"/paper/2504.08748/citation-record.json","paper":"/paper/2504.08748"},"outbound":[],"paper":{"arxiv_id":"2504.08748","last_updated":"2025-03-26T02:43:09Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T16:36:50.724725Z","submitted_at":"2025-03-26T02:43:09Z","title":"A Survey of Multimodal Retrieval-Augmented Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2504.08748."}