{"as_of":"2026-08-23T18:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e893a65d6f3ba9a95c1af7172a7d506684d3c277dbe44b61ffd537bef7487af0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:22:10.964965Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:59:46.832017Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-21T23:30:51.447560Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T14:36:09.971825Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2305.18565"},"observation_digest":"sha256:42d7363fcaf7ea074c455ded24d4f77c79947dc59fad80d9538c37a412921390","observation_id":"b6bfed60-da5a-4134-b7a6-b87f524b9d9b","resolution":{"observed_at":"2026-05-17T14:36:10.023151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-11T16:22:10.964965Z","title":"XTuner Contributors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10151","last_updated":"2024-12-13T14:11:26Z","snapshot_observed_at":"2026-08-14T15:57:38.415743Z","submitted_at":"2024-12-13T14:11:26Z","title":"VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:22:10.964965Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2412.10151"},"observation_digest":"sha256:e661584d6055354a80c6d066a104eaabbe75d007cf3cd51453f309c5922c2698","observation_id":"a4f59d38-5b45-41f7-af56-f14df06e3ed3","resolution":{"observed_at":"2026-08-11T16:22:10.964965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-08T05:54:15.864357Z","title":"Can pre-trained vision and language models answer vi- sual information-seeking questions? arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-18T03:47:13.063220Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.864357Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:fa3d386dd01f4a6b617d6e66a1ad50b391f7059cedb5e67fa00daa7ae9d4d1d4","observation_id":"3109636d-67a5-415a-baff-0e63cb21a129","resolution":{"observed_at":"2026-08-08T05:54:15.864357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-07T14:46:45.236100Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-13T16:17:34.753862Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:45.236100Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:e6dcb267750a0ceeb1ee548465a79711eebfc576b988d8dd12c0a54b86b8ccbd","observation_id":"16a8baad-8059-40d3-af0d-6ecc6d78427f","resolution":{"observed_at":"2026-08-07T14:46:45.236100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-07T14:32:55.697518Z","title":"Can pre-trained vision and language models answer visual information-seeking questions? arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18543","last_updated":"2025-05-24T06:17:59Z","snapshot_observed_at":"2026-08-17T16:10:43.015488Z","submitted_at":"2025-05-24T06:17:59Z","title":"Benchmarking Poisoning Attacks against Retrieval-Augmented Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:55.697518Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2505.18543"},"observation_digest":"sha256:0fb979727d33960cfec1bba1f1f49c14200f034522e1053d455f05a7e3d37c96","observation_id":"c1780cfb-b22e-4278-807b-4b7dcdd9248a","resolution":{"observed_at":"2026-08-07T14:32:55.697518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-07T13:30:17.778638Z","title":"Can pre-trained vision and language models answer visual information-seeking questions? ArXiv, abs/2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21771","last_updated":"2026-05-23T17:30:43Z","snapshot_observed_at":"2026-08-20T02:00:21.519496Z","submitted_at":"2025-05-27T21:09:11Z","title":"MMTABREAL: Real-World Benchmark for Multimodal Table Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:17.778638Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2505.21771"},"observation_digest":"sha256:adf66313742a7c163d7ba850a6adc43cd3a24920952fa1929231eb23e42231aa","observation_id":"e8b593f0-fa3a-43dd-82f9-2874a2ab121a","resolution":{"observed_at":"2026-08-07T13:30:17.778638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2505.22095","last_updated":"2026-04-06T12:52:40Z","snapshot_observed_at":"2026-08-12T21:09:04.668282Z","submitted_at":"2025-05-28T08:17:57Z","title":"Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T13:50:30.090068Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2505.22095"},"observation_digest":"sha256:c97f0bf6188bf6955dc25216eb5c4caa9b6b372ea80206d49f76d7211d326641","observation_id":"bfa67e94-d0bc-4c11-8444-04a73de81995","resolution":{"observed_at":"2026-05-19T13:52:19.894702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-07T13:21:40.614803Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23828","last_updated":"2025-05-28T07:44:10Z","snapshot_observed_at":"2026-08-13T17:30:33.422266Z","submitted_at":"2025-05-28T07:44:10Z","title":"Spa-VLM: Stealthy Poisoning Attacks on RAG-based VLM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:40.614803Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2505.23828"},"observation_digest":"sha256:d77beeb9849df7af17f24b3e610ade187672024d20b694886ca5d003775dfe6c","observation_id":"261c7fb3-9da8-48e0-95c6-3f92a1fafaf9","resolution":{"observed_at":"2026-08-07T13:21:40.614803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T23:57:21.914960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.914960Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:5b7aa01c36be83fc7876dedb1aab93b823d761e6d45f10f0f78366f418719ce3","observation_id":"0eed1381-9216-4444-9d52-308e0adc1ca9","resolution":{"observed_at":"2026-08-06T23:57:21.914960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-08-14T00:24:35.202988Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:ca40607d16ef5dfc1f7cc4c79c6dc632c97760afba1832d6b46a9c7394f939ed","observation_id":"17b0c8a1-b73e-4bf0-bf58-3901c577b7e7","resolution":{"observed_at":"2026-05-16T15:27:04.427821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T12:18:32.356535Z","title":"Can pre-trained vision and language models answer vi- sual information-seeking questions? arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-15T10:04:01.608984Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.356535Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:af8b992a666a4086a925566a2b29c2554d945bc48275adc2d34e0eb223498d48","observation_id":"b2b48a63-6335-45e0-b0b6-35b2fc97d4c6","resolution":{"observed_at":"2026-08-06T12:18:32.356535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T14:33:31.536273Z","title":"org/CorpusID:212814759","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-15T15:23:34.215982Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:31.536273Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:912de2ca1b2d5a5204e6edd89d9038118a760b05fe68da4fe5d360c9dbf66aeb","observation_id":"a7d9639e-f645-4088-80e7-25eeee52864d","resolution":{"observed_at":"2026-08-06T14:33:31.536273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-12T15:21:22.765600Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:19e678156d30443f21bb487416311112c8420d7ce93fabaa256e61fb7f908e4a","observation_id":"76c4a3da-e9a7-4fa5-b398-b019731279ff","resolution":{"observed_at":"2026-05-15T18:56:23.880172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:1d96d4eedb9109005c7693a1ab2614e3bb2f53a0926a8879de198c53bcc5400a","observation_id":"ea7054b4-df8a-41ef-a8c0-4066d635aa22","resolution":{"observed_at":"2026-05-16T05:32:29.538412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2602.00104","last_updated":"2026-06-03T13:13:52Z","snapshot_observed_at":"2026-08-16T10:21:20.753373Z","submitted_at":"2026-01-25T12:12:12Z","title":"R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T10:46:17.411843Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2602.00104"},"observation_digest":"sha256:7725bde86da55ea22ec93e6c1e425c1c9b637443da725e503bcc26d37cab1f0b","observation_id":"e880ec27-3ea7-45b3-8290-d63e329b92e4","resolution":{"observed_at":"2026-05-16T10:47:45.512121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-03T08:13:52.772526Z","title":"Can pre-trained vi- sion and language models answer visual information-seeking questions?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00104","last_updated":"2026-06-03T13:13:52Z","snapshot_observed_at":"2026-08-16T10:21:20.753373Z","submitted_at":"2026-01-25T12:12:12Z","title":"R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:52.772526Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2602.00104"},"observation_digest":"sha256:cf1aba7f30760530d4de0e74c1a978a7b1fcca299f4525e273b652c8d2757ac9","observation_id":"0f8b9170-1c4c-4886-bf4a-bcaa4ed1c4c7","resolution":{"observed_at":"2026-08-03T08:13:52.772526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2603.04751","last_updated":"2026-04-27T08:53:25Z","snapshot_observed_at":"2026-08-17T00:21:27.533456Z","submitted_at":"2026-03-05T02:56:42Z","title":"Evaluating the Search Agent in a Parallel World","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T17:02:10.963839Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2603.04751"},"observation_digest":"sha256:db04296cea7999152aa9eb9f74d6edcfd5e151e0bb4f1298d37da1aaa36e9c4a","observation_id":"bd1c256f-8a67-45d1-bb0d-622d9aac99ed","resolution":{"observed_at":"2026-05-15T17:06:19.398333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Can pre-trained vision and language models answer visual information-seeking questions? ArXiv, abs/2302.11713,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-15T11:05:28.641637Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:22a1ca5cc79c5d1452556680f409a3f01327aec6072d7ca97201f030ab9d8ab0","observation_id":"4fd4f9ae-c567-4359-a94a-2355379060a8","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T13:11:54.384284Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:cea601b90597df63db8e244f4cb5cb24430981ad4ec13c35a223e4546f7236c8","observation_id":"2df65d05-b063-4535-bd42-fb830a64fa75","resolution":{"observed_at":"2026-05-15T13:15:50.617495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-14T23:55:24.006436Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?ArXiv, abs/2302.11713,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T23:55:24.006436Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:90ef78cda6b803414ed47ea0837aedd1726c01c6144b75cb92a3d85c58e5ffb1","observation_id":"3c589ea0-4333-4bed-9a40-68f66b2496c2","resolution":{"observed_at":"2026-07-14T23:55:24.006436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2604.07146","last_updated":"2026-04-09T05:15:38Z","snapshot_observed_at":"2026-08-18T18:40:15.832268Z","submitted_at":"2026-04-08T14:37:35Z","title":"Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:32.352399Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2604.07146"},"observation_digest":"sha256:fd8450efc612e8c892383b11aa2eee9f0cf160aafd37478bb3b0ecaa8a8af4d9","observation_id":"04d5088e-69fd-4c27-a7c0-95a147f5c88f","resolution":{"observed_at":"2026-05-11T05:55:59.357888Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-08-15T12:15:40.918493Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:aaaf3716d4e98f79065ec1ec36b4fe283793d8e52eb83a8a8d5177cec787411d","observation_id":"f65682d5-c688-4328-a206-d66109f75ec6","resolution":{"observed_at":"2026-05-11T12:31:08.003540Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2604.20486","last_updated":"2026-04-22T12:20:46Z","snapshot_observed_at":"2026-08-13T02:38:48.328197Z","submitted_at":"2026-04-22T12:20:46Z","title":"ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T01:12:17.469552Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2604.20486"},"observation_digest":"sha256:02539a01530c11c608c430f37c526824eefba3dbbeab32b25c4520219e87eb43","observation_id":"17253701-54e0-494f-99cf-108285154a07","resolution":{"observed_at":"2026-05-11T13:41:09.791197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2604.26419","last_updated":"2026-04-29T08:29:44Z","snapshot_observed_at":"2026-08-17T08:49:45.010626Z","submitted_at":"2026-04-29T08:29:44Z","title":"Delineating Knowledge Boundaries for Honest Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T13:56:19.635005Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2604.26419"},"observation_digest":"sha256:a70bfca0f2673a800678bc002c6b6b931b133e3c545d65ddf29bc6a9fe4cad1d","observation_id":"4dfc9e15-e7ef-4c77-9ef1-356eb94b06a6","resolution":{"observed_at":"2026-05-12T08:46:25.309052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2605.14906","last_updated":"2026-05-14T14:41:17Z","snapshot_observed_at":"2026-08-16T02:15:39.863756Z","submitted_at":"2026-05-14T14:41:17Z","title":"MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-30T21:00:25.664841Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2605.14906"},"observation_digest":"sha256:ead384ec542b4d46edfa472d3fa88324c8ca564cfa13a5f5c7c952d0b564b2e8","observation_id":"6fabff02-2f74-430d-995d-3bcac17718dc","resolution":{"observed_at":"2026-06-30T21:05:04.194601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-08T01:57:17.698279Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:495e8fc4625f7247884dd87b4df7f61eb099720b10eac72afe848f3b4c5f4009","observation_id":"c7219241-79d1-4bb5-9a7d-668821257ec8","resolution":{"observed_at":"2026-07-03T20:18:57.778198Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2606.23881","last_updated":"2026-06-22T19:27:00Z","snapshot_observed_at":"2026-08-13T01:37:35.388018Z","submitted_at":"2026-06-22T19:27:00Z","title":"Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T08:12:14.829556Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2606.23881"},"observation_digest":"sha256:52fd29bc738fd62e2ea5676e024fca6043ed905de1dd27fc6f19cb69d2a05749","observation_id":"cdc4ff57-90a9-4fd6-938f-fe148251fffa","resolution":{"observed_at":"2026-07-04T10:59:46.833645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2606.31504","last_updated":"2026-06-30T11:22:24Z","snapshot_observed_at":"2026-08-12T18:44:43.168315Z","submitted_at":"2026-06-30T11:22:24Z","title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-01T06:02:48.532478Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2606.31504"},"observation_digest":"sha256:e8acee63d19b59c49c58effdf2532ed7fff18c7eb5905fd7c721f61dfb89ce7a","observation_id":"fcf7514f-5791-4cb5-b6b6-aacdc5ce8d7c","resolution":{"observed_at":"2026-07-01T09:55:41.073138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2607.00159","last_updated":"2026-06-30T20:35:30Z","snapshot_observed_at":"2026-08-17T11:12:15.091346Z","submitted_at":"2026-06-30T20:35:30Z","title":"Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T19:13:44.015782Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2607.00159"},"observation_digest":"sha256:f5e14450d1feca5b247da4bf9822e93e80b08fb76dc2e9d8e0696e8cdc4456d5","observation_id":"a1c92dfb-b7d4-4e0d-8081-6a6b85515075","resolution":{"observed_at":"2026-07-02T19:17:17.746673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-02T10:20:52.536689Z","title":"arXiv preprint arXiv:2302.11713 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-16T05:48:21.160961Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:52.536689Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:c01657dc6e337ad6105ef3f1c2386acadee43a39fc478beed83281a2875b9101","observation_id":"bfdd7a1d-5754-44bc-b4ee-de7fe08b7503","resolution":{"observed_at":"2026-08-02T10:20:52.536689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T00:31:14.890550Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-15T10:22:48.930149Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:14.890550Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:7ec7c646183d931f9bbe659d6f015f305936e55d3a74138c9b1769fb04696021","observation_id":"a9ee170d-edfb-4ad2-8703-e2033d4bd1f9","resolution":{"observed_at":"2026-08-06T00:31:14.890550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T04:19:50.895716Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-15T10:22:48.930149Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:50.895716Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:2ae2623fb2a30482df34000e040ae3f3d4366a0429519298901bc5b83ec28e1a","observation_id":"10cad550-eafc-443e-b7b9-4b4853ee7ce6","resolution":{"observed_at":"2026-08-06T04:19:50.895716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-05T04:44:29.820822Z","title":"arXiv preprint arXiv:2302.11713 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-17T01:10:46.970050Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.820822Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:d3e888bdb5d1eb3c355c0f8ef670a3f673d8c2b0e4799c36e26ada57c97123b4","observation_id":"5bf954f1-ee33-40a1-9b60-d5801e39a2c0","resolution":{"observed_at":"2026-08-05T04:44:29.820822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2302.11713/citation-record","integrity":"/paper/2302.11713/integrity","json":"/paper/2302.11713/citation-record.json","paper":"/paper/2302.11713"},"outbound":[],"paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T08:46:46.127788Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2302.11713."}