{"as_of":"2026-08-09T13:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e03433ee397e03874041f92f9a27ae8b8ac0e837509c304765b9afbea0fe598b","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:24:54.668238Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:23:34.984840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.135392Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-08-06T13:23:34.984840Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-07T01:11:37.463830Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:34.984840Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:f06f71086bceb321eb805684468b176927515251ee4dba0cefad3109a997d302","observation_id":"e4dc91ff-51d2-4752-aa5a-47c8c4b80e89","resolution":{"observed_at":"2026-08-06T13:23:34.984840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-08-05T22:52:00.547279Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.547279Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:6fbd8ceb5676b91936a7260f147e34432bd6721732958fdd7c33c41b695bdc0e","observation_id":"bf6bdab8-5b24-4a69-9e98-363b25af0fbb","resolution":{"observed_at":"2026-08-05T22:52:00.547279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:817163ed960ccaff9bb65aa56b3dec83f733dd30efbd2fb7d502414c0cb6cbcf","observation_id":"1a8a7c1b-2d4e-46f7-b0c4-35065cf68ee2","resolution":{"observed_at":"2026-05-16T05:32:29.448501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2604.04017","last_updated":"2026-04-05T08:29:52Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T08:29:52Z","title":"GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T17:31:08.575993Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2604.04017"},"observation_digest":"sha256:33e919b538c9a3e3a5768edff22a559e52282d82e92dce4ebd180afdb8784dc9","observation_id":"2967d069-f60e-4f57-8581-64b9eed36b05","resolution":{"observed_at":"2026-05-13T17:33:02.362467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2604.07419","last_updated":"2026-04-08T14:47:27Z","snapshot_observed_at":"2026-08-02T16:37:23.824907Z","submitted_at":"2026-04-08T14:47:27Z","title":"ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:15.630570Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2604.07419"},"observation_digest":"sha256:409a0f98db77c838570a454e4204ab73a8119507e5dd68a386e220223a07fee8","observation_id":"97ad0c2a-e9dc-4d15-8928-993a8a37b856","resolution":{"observed_at":"2026-05-11T06:15:58.159597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2604.09508","last_updated":"2026-04-10T17:25:34Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T17:25:34Z","title":"VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:21.088097Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2604.09508"},"observation_digest":"sha256:d365aa2510b2400386a7e8a78da0e8ed3746c8ca68dd9ef6060e1f39cd772f74","observation_id":"bec402f7-7a52-459e-b962-8d50ea8d82cf","resolution":{"observed_at":"2026-05-11T06:11:03.331597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-02T16:18:18.484070Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:24.304696Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:9e8fdadd9560fa01671887029427973d15449267c6787ce2526182aadca4a543","observation_id":"36ea29d2-7175-46ed-95d2-4625e83a559c","resolution":{"observed_at":"2026-05-10T13:10:26.498983Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-08-02T16:18:24.497209Z","title":"arXiv preprint arXiv:2505.22019 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-02T16:18:18.484070Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:24.497209Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:2b77024ac6b62d993691e80a3dd65d84c8e16a825266d5009566265ce5b1f937","observation_id":"ca24bd0d-f4ba-4938-9eea-6f75e42bbbf8","resolution":{"observed_at":"2026-08-02T16:18:24.497209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2605.03903","last_updated":"2026-05-05T15:56:12Z","snapshot_observed_at":"2026-07-06T23:16:44.876986Z","submitted_at":"2026-05-05T15:56:12Z","title":"CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-07T16:18:35.484800Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2605.03903"},"observation_digest":"sha256:704ac69f4bc20aabfb191596513d43ebf51d6ebd9be3595228984866af93fd8e","observation_id":"37e43759-ef2d-4700-bc61-27bd5aa2e355","resolution":{"observed_at":"2026-05-11T23:46:49.213351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2605.15710","last_updated":"2026-05-15T08:00:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-15T08:00:46Z","title":"SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T19:11:15.761831Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2605.15710"},"observation_digest":"sha256:8d2806a156ca2dd6c2b4a12e1c5db6c085aa593c939e4e12508b0bb231bf07b0","observation_id":"ce49c680-a71e-42ed-919f-fd2c54d9a638","resolution":{"observed_at":"2026-05-20T19:13:40.493453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:7108712e3034e27433c63af133ff4d7583c7b37183846dc3fa19a217f704a9da","observation_id":"39c126c9-dc8c-43cd-8c4d-2adf8647af8b","resolution":{"observed_at":"2026-07-04T15:09:55.136829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.22019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-04T15:09:55.135392Z","title":"Vrag-rl: Empower vision-perception-based rag for visually rich information understanding via iterative reasoning with reinforcement learning","venue":null,"work_id":"a9298982-6585-453b-a574-93d354bd1d51","year":2025},"citing_paper":{"arxiv_id":"2606.31504","last_updated":"2026-06-30T11:22:24Z","snapshot_observed_at":"2026-08-08T20:17:46.874902Z","submitted_at":"2026-06-30T11:22:24Z","title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-01T06:02:48.532478Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2606.31504"},"observation_digest":"sha256:32948764010cd811822efe03da7319b370c7305f20e86185b799ab7dbccc7a37","observation_id":"6ad6b6c6-2c8d-42bc-8c53-fde35b53ed31","resolution":{"observed_at":"2026-07-01T09:55:41.069237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2505.22019 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:0e36b5f94d3175697ec703ed98e9f083e436007c653c20017e5e6d5e2454fe0f","observation_id":"c51fda0a-6a8b-47ae-ae27-03d8243df2b8","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2505.22019 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:1f00a6123a56310d654599d7eb91024a63573e2e59d61d686aff7c46338d6627","observation_id":"bb841e23-0e1c-448e-9519-cdee7432d478","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-08-03T02:57:49.554753Z","title":"2505.22019 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29638","last_updated":"2026-07-31T17:17:23Z","snapshot_observed_at":"2026-08-05T23:16:10.484920Z","submitted_at":"2026-07-31T17:17:23Z","title":"HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-03T02:57:49.554753Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2607.29638"},"observation_digest":"sha256:5b76b200896cc60e31e461335d1de1de54fbc1f255cd1642862d662959ffd989","observation_id":"b77f11b1-eb43-4aaa-a7ba-0da6aa9f7156","resolution":{"observed_at":"2026-08-03T02:57:49.554753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-08-05T04:44:27.203082Z","title":"arXiv preprint arXiv:2505.22019 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-08T22:37:29.099029Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.203082Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:db2bbded883a291d285bc106058cb0736e952a5810b7d2c55fc07dc273252538","observation_id":"07c32dab-92fe-471c-a56d-9a84f9aad946","resolution":{"observed_at":"2026-08-05T04:44:27.203082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22019/citation-record","integrity":"/paper/2505.22019/integrity","json":"/paper/2505.22019/citation-record.json","paper":"/paper/2505.22019"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:48.648661Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:48.648661Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:f4b22afa2eb4506d131e2f986a0cbcc6172816b97316675821ad5a09b86e1a76","observation_id":"69531200-78c5-409b-9075-705dee559482","resolution":{"observed_at":"2026-08-07T13:24:48.648661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:24:48.786792Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:48.786792Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:23f552785ef536ea6e44659d5f3b5a74dec6b03bf0651f070a9fe09d3a5b3e8d","observation_id":"e8ccdf16-eff3-4b06-8bc0-390b31df102e","resolution":{"observed_at":"2026-08-07T13:24:48.786792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:56.842016Z","title":"Benchmarking large language models in retrieval-augmented generation","venue":null,"work_id":"7488c97c-e417-45b9-b9e1-60fbd2f87eb6","year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:48.906125Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:d97e458cba5fc345ca3af6361c4b492686e2374d9803de90f3f4e799ef2efdc4","observation_id":"268315af-74ce-4a4d-8877-217f37f1bfc5","resolution":{"observed_at":"2026-08-07T13:24:56.946878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:56.646222Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than \\ 3","venue":null,"work_id":"cc6160ae-101a-4461-9953-72aa446faac5","year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:48.998331Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:8751e439a95a2fe434ca31642a6d0aaeea508b2673176213de89f032d4029e9b","observation_id":"5baac46d-a7d7-4111-b649-57ccaf6cddc8","resolution":{"observed_at":"2026-08-07T13:24:56.741210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-08-09T02:50:54.082128Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-07T13:24:49.147441Z","title":"Research: Learning to reason with search for llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:49.147441Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:233b6ee4ff9fd50140f75499e88f8039cbaf3babeb0603c9e900d08ba7792435","observation_id":"cb69defb-b57e-41c1-bb83-ccf06e98986f","resolution":{"observed_at":"2026-08-07T13:24:49.147441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:49.352425Z","title":"Mindsearch: Mimicking human minds elicits deep ai searcher","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:49.352425Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:38d0f511c0a26602661d235780a9ff2d409c2c3ce157b4b00027accb9a1d7acf","observation_id":"0af78db5-411e-4aa0-afe7-7ceefecb0d9d","resolution":{"observed_at":"2026-08-07T13:24:49.352425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12881","last_updated":"2024-03-19T16:26:10Z","snapshot_observed_at":"2026-07-06T17:47:06.731501Z","submitted_at":"2024-03-19T16:26:10Z","title":"Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12881","snapshot_observed_at":"2026-08-07T13:24:49.490774Z","title":"Agent-flan: Designing data and methods of effective agent tuning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:49.490774Z"},"links":{"cited_paper":"/paper/2403.12881","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:624ac1b11775fa68e15e71c5f53ec2cee099be75a6943397c5c663aa2974a1af","observation_id":"762efeb2-6d0c-4bec-97a0-d036d833bbeb","resolution":{"observed_at":"2026-08-07T13:24:49.490774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:24:49.709222Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:49.709222Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:e7ec9f59788c3109dede130e094fd2808d7d7015bbb02abd3bea411718a28e2d","observation_id":"e9790918-9649-4cc5-ab71-331c48752194","resolution":{"observed_at":"2026-08-07T13:24:49.709222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-07T13:24:49.927205Z","title":"M3docrag: Multi-modal retrieval is what you need for multi-page multi-document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:49.927205Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:e39b2088fcd62d9c6bf0abcf16341f547a1cbe44eb52f7eda4faaed1642795b4","observation_id":"d32f2860-0616-4982-b3a8-d69e8cd7924b","resolution":{"observed_at":"2026-08-07T13:24:49.927205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-07T13:24:50.065723Z","title":"Pp-ocr: A practical ultra lightweight ocr system, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.065723Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:e4c8c8b1778bd04afa14923cc29ad2a90b979582d6c0dac1c456e517ceb634ea","observation_id":"b8925cca-2976-4e05-b1cd-19f0c477861c","resolution":{"observed_at":"2026-08-07T13:24:50.065723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:56.444759Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":"f6bd8104-4341-4db6-9b2f-9cab3d2b276b","year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.220936Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:e210f444fe361fa282dc3332379c3d4877088625f88aead0595a2bad4095c7ef","observation_id":"acb7fd87-8eb6-47a1-bd8b-4ed82d8b5d9e","resolution":{"observed_at":"2026-08-07T13:24:56.538027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T13:24:50.367366Z","title":"Retrieval-augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.367366Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:71610ca86d82ce4c2cfeb76de0fe4f576f04d56b5d6da24d6b9cbb6002468f20","observation_id":"b48724e1-3d34-4973-8f85-220a4d7e13b9","resolution":{"observed_at":"2026-08-07T13:24:50.367366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:24:50.460221Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.460221Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:b7755cdb480836720ce6d8dd4488429f65e4397aea9bc9072dcd0fcbd8c25ddf","observation_id":"07fc34a4-9d1a-4da1-a76d-6a940277e99b","resolution":{"observed_at":"2026-08-07T13:24:50.460221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T13:24:50.559672Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.559672Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:c49886694a9ec623868029d41615f17005faa30e1150d3a2ab31d3799d91a3ed","observation_id":"7ff22933-ee18-42ad-9a6e-3307aa72aa7c","resolution":{"observed_at":"2026-08-07T13:24:50.559672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:24:50.683709Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.683709Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:b3f8e3614c56f2e9fb3fd06f9eacc43089b684e898a25b562d5ef7ba85a09991","observation_id":"00eeeb99-9d5a-4aeb-9c23-ed590f381a76","resolution":{"observed_at":"2026-08-07T13:24:50.683709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-07T13:24:50.840704Z","title":"Mmsearch: Benchmarking the potential of large models as multi-modal search engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.840704Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:73b052a72a6c945ef810019109e493f0706788c6c92db22a4cc95e4e618e850b","observation_id":"00e16907-51c7-4867-a3b2-3f372a8b503a","resolution":{"observed_at":"2026-08-07T13:24:50.840704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00223","last_updated":"2025-04-12T03:17:26Z","snapshot_observed_at":"2026-08-07T17:38:11.374070Z","submitted_at":"2025-02-28T22:16:42Z","title":"DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00223","snapshot_observed_at":"2026-08-07T13:24:50.943846Z","title":"Deepretrieval: Hacking real search engines and retrievers with large language models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:50.943846Z"},"links":{"cited_paper":"/paper/2503.00223","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:835bc941255910b74ee6ef69c207ba7d8025bcb7aab2c42c195cf54d7ea00ece","observation_id":"f7548be0-6977-4d9b-8ed3-e540525ea30f","resolution":{"observed_at":"2026-08-07T13:24:50.943846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05983","last_updated":"2024-10-08T12:30:07Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:30:07Z","title":"Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05983","snapshot_observed_at":"2026-08-07T13:24:51.082163Z","title":"Long-context llms meet rag: Overcoming challenges for long inputs in rag","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.082163Z"},"links":{"cited_paper":"/paper/2410.05983","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:8cbe2f703513ae9860ce6de8af0dbcf69a1fd447a4acbe91cc808cb5beeb8c1c","observation_id":"0914aadd-44d0-486a-a3d4-d761414d506c","resolution":{"observed_at":"2026-08-07T13:24:51.082163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T13:24:51.217474Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.217474Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:69d00fadcca8c3d4bbcfbd349862171ff44403c319657340c6c5a4d27168ea24","observation_id":"9ead5704-8345-4c87-852f-5f9e97d29a78","resolution":{"observed_at":"2026-08-07T13:24:51.217474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:56.273259Z","title":"Reinforcement learning: A survey","venue":null,"work_id":"fc038093-87e8-4532-87d3-513f72dd84f5","year":1996},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.389300Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:49314c08d2695c3782c5ad552fa7903ba9e20390bdec89be70603c27cd8c20df","observation_id":"8e205582-82cd-4269-8724-f25b68dd7ad2","resolution":{"observed_at":"2026-08-07T13:24:56.351090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-07T13:24:51.601363Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.601363Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:49acfe7f3a55439b20e401248d5354bb8e5e3376c20e5c96b13c17127f7040c5","observation_id":"6d2d3ac9-3765-48a5-8255-04acfd34cbbf","resolution":{"observed_at":"2026-08-07T13:24:51.601363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:51.700223Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.700223Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:642b4490b0edd092c7cd92741e8cb7ed305037d64f204fa028262088d25dee3e","observation_id":"c2d12a3a-869d-4955-84ef-bb3ddd92a9cb","resolution":{"observed_at":"2026-08-07T13:24:51.700223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-07T13:24:51.824122Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.824122Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:a50779de05048a13d10732db5611622a6007e70303bddc0db43a0619295b14b4","observation_id":"b0219256-bd67-4df6-9a69-389dde6c5c69","resolution":{"observed_at":"2026-08-07T13:24:51.824122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02937","last_updated":"2025-05-26T06:14:02Z","snapshot_observed_at":"2026-08-02T09:25:53.693440Z","submitted_at":"2024-11-05T09:27:21Z","title":"Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02937","snapshot_observed_at":"2026-08-07T13:24:51.884343Z","title":"Benchmarking multimodal retrieval augmented generation with dynamic vqa dataset and self-adaptive planning agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.884343Z"},"links":{"cited_paper":"/paper/2411.02937","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:0bf4118eaf907e0cef76e2399d1d4d24ce580f39449aa7d3f4e7c33900daab8d","observation_id":"11459a76-2481-48f2-b128-0ef82e496bae","resolution":{"observed_at":"2026-08-07T13:24:51.884343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-07T13:24:51.963166Z","title":"Towards general text embeddings with multi-stage contrastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:51.963166Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:1836c5fef7ad9a6944e37e7f10c8b3634fd690c9eaf9f5998423b78c4b638336","observation_id":"8b9ceca8-29b6-4506-b59b-b18646e7e1e1","resolution":{"observed_at":"2026-08-07T13:24:51.963166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:52.036227Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.036227Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:0ea20709667a31194617ebbb3f4125b974d0976b03b41d76f1f1f28bf15ec190","observation_id":"e8acbfd5-bd5a-4648-b7b9-5e14039ded2f","resolution":{"observed_at":"2026-08-07T13:24:52.036227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:52.146606Z","title":"LlamaIndex , 11 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.146606Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:303474f5f4ed9bef1655282bd8cff7a680d34b593baf8d2e6473c8832af6a08e","observation_id":"e0f17fc1-8a65-485b-ae63-665bbe9a6844","resolution":{"observed_at":"2026-08-07T13:24:52.146606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T13:24:52.248859Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.248859Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:b719b2169013bc71e9f385fb2492ffbd619eabd0a288f30bbb08f5546de2adb6","observation_id":"02dc48b8-0155-4e5a-a008-61cb42d6d12e","resolution":{"observed_at":"2026-08-07T13:24:52.248859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-08-06T08:51:10.907429Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-08-07T13:24:52.343132Z","title":"Mmlongbench-doc: Benchmarking long-context document understanding with visualizations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.343132Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:8a2cb8cec7196d4bd38f8f1af9cb3b0aba56c4846b4381fe9af2e91ffd6a59f1","observation_id":"c0ed3f2c-aa1f-435a-90bb-bee0c89944d7","resolution":{"observed_at":"2026-08-07T13:24:52.343132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T13:24:52.421805Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.421805Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:1d4d90811b58166eaf63fdb509be3a67cad85b0ba2c77107cefa5764ab05cb1b","observation_id":"d634e7bc-32f8-43f8-a76e-bec59d2d6849","resolution":{"observed_at":"2026-08-07T13:24:52.421805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:52.518896Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.518896Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:7bee5d3132eb6ee5d837ef6b4af8cef657c4724da2ee6e0f047054277a545a9b","observation_id":"2c2ea2cf-8642-469e-924b-799c5c19984d","resolution":{"observed_at":"2026-08-07T13:24:52.518896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15831","last_updated":"2025-02-07T15:17:18Z","snapshot_observed_at":"2026-08-06T10:11:12.752175Z","submitted_at":"2024-07-22T17:50:31Z","title":"NV-Retriever: Improving text embedding models with effective hard-negative mining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15831","snapshot_observed_at":"2026-08-07T13:24:52.610720Z","title":"Nv-retriever: Improving text embedding models with effective hard-negative mining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.610720Z"},"links":{"cited_paper":"/paper/2407.15831","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:18754a7a540f3a759af3294173e35d4aa57b0b5196e89efb223ac3c6d5a7c210","observation_id":"4c8c0d4e-b367-4663-93eb-1233a01ea3dd","resolution":{"observed_at":"2026-08-07T13:24:52.610720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:52.679894Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.679894Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:d78022bef267f6dba870fd516c1a04ca0ef9c8b96c3a1e8a0da907697ab2482c","observation_id":"4dd90c39-b902-4ffc-b08b-f7206b3b0c2e","resolution":{"observed_at":"2026-08-07T13:24:52.679894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:52.763882Z","title":"Introducing gemini 2.0: our new ai model for the agentic era, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.763882Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:9a40b90e5b3c996c511a6643f33de58341bf489feacb47637699b3f67cf0541d","observation_id":"fcafe132-9e4f-4759-bc04-037d07ee81cb","resolution":{"observed_at":"2026-08-07T13:24:52.763882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:52.861519Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.861519Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:bcae1766bd5018e5c6d501931034e7abaa7b29d10377fa8befec543f4a54f6fd","observation_id":"d251e266-f212-41fb-bcc0-cba2aec026cf","resolution":{"observed_at":"2026-08-07T13:24:52.861519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:24:52.950386Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:52.950386Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:6b2e30fb54cf60dc17cd5d93baeb3ae05bd87e4829f249610d3828af99b38348","observation_id":"f33cf807-ebaa-485e-92ef-8f9286a003c8","resolution":{"observed_at":"2026-08-07T13:24:52.950386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:55.961665Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"e4e50cae-1c03-4412-9642-3860eefd0168","year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.041498Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:d1aaf6ca3e5d7145fa284174908b1a2fc724165f27f88dae2e3c08d60ef9516c","observation_id":"65ebfb42-2e5d-49bc-9dfe-29506b85d40c","resolution":{"observed_at":"2026-08-07T13:24:56.100544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T13:24:53.171877Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.171877Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:a0686da13eebd72276964d7e305d781bcf1e14004d7fa3d920a2ab794d727a13","observation_id":"d74a9cfd-9ee9-48f7-b84d-946c85862326","resolution":{"observed_at":"2026-08-07T13:24:53.171877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:55.687449Z","title":"Reinforcement learning","venue":null,"work_id":"4ffefd21-0875-433f-b1d5-af36b3a3683a","year":1999},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.264735Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:bf3aead17e781ff9de1a292995126275eac0c8eef15f88b63e1f5f7b9b6303ca","observation_id":"b86812e1-643b-4b23-82d6-b42c127aa112","resolution":{"observed_at":"2026-08-07T13:24:55.809640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:55.495924Z","title":"Slidevqa: A dataset for document visual question answering on multiple images","venue":null,"work_id":"71b95df9-8957-4c18-b42b-64b2cab8c9a7","year":2023},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.364738Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:926a42a57d2a0f781b5affd8954859c001442576b06f989c3afbdfc875dbbdeb","observation_id":"ebfbe6e8-0a78-475e-9803-6fd86710633c","resolution":{"observed_at":"2026-08-07T13:24:55.604920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18017","last_updated":"2025-06-03T05:34:30Z","snapshot_observed_at":"2026-08-07T17:50:42.770308Z","submitted_at":"2025-02-25T09:26:12Z","title":"ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18017","snapshot_observed_at":"2026-08-07T13:24:53.442043Z","title":"Vidorag: Visual document retrieval-augmented generation via dynamic iterative reasoning agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.442043Z"},"links":{"cited_paper":"/paper/2502.18017","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:019132d933931ff5af3a4cce552e71862d6b7c75d6e53e24bfc5ad7dae6bec10","observation_id":"056425ae-5ace-4508-a89e-5f31bb5c7e35","resolution":{"observed_at":"2026-08-07T13:24:53.442043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-07T13:24:53.487266Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.487266Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:6b02a863e6d3b7e817b1bf40ed13edbdaade86fce4fd5d6814d2ba3275529a81","observation_id":"6ebaea24-4713-4d9a-a30b-d63e2cd79fc3","resolution":{"observed_at":"2026-08-07T13:24:53.487266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:53.586633Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.586633Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:e31d57954d72f0888ca5095d60992d4d82c5ffa1a5a99d9175ae9fe875495f9e","observation_id":"5bd4bdc1-02f8-4d2f-98c2-88b1d53c7328","resolution":{"observed_at":"2026-08-07T13:24:53.586633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07572","last_updated":"2025-08-10T05:59:20Z","snapshot_observed_at":"2026-08-04T14:46:05.418102Z","submitted_at":"2025-01-13T18:58:07Z","title":"WebWalker: Benchmarking LLMs in Web Traversal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07572","snapshot_observed_at":"2026-08-07T13:24:53.713826Z","title":"Webwalker: Benchmarking llms in web traversal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.713826Z"},"links":{"cited_paper":"/paper/2501.07572","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:410e844e6b8b964ab3fc9f83fa2557cb4ee1723d7658a6603dcf980664c421ca","observation_id":"f15666ee-bdbc-4691-9a14-5246d2f099a3","resolution":{"observed_at":"2026-08-07T13:24:53.713826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00888","last_updated":"2025-01-01T16:28:21Z","snapshot_observed_at":"2026-07-06T20:15:31.955797Z","submitted_at":"2025-01-01T16:28:21Z","title":"Unfolding the Headline: Iterative Self-Questioning for News Retrieval and Timeline Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00888","snapshot_observed_at":"2026-08-07T13:24:53.810076Z","title":"Unfolding the headline: Iterative self-questioning for news retrieval and timeline summarization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.810076Z"},"links":{"cited_paper":"/paper/2501.00888","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:9be09573914ab1057f5ec75085f5ad74640e46306b304049323beb526fa4b677","observation_id":"e328ef64-c72b-47c8-8eda-6451b5932802","resolution":{"observed_at":"2026-08-07T13:24:53.810076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:55.328945Z","title":"Rule: Reliable multimodal rag for factuality in medical vision language models","venue":null,"work_id":"2afa1ed0-8ab5-4c36-ac7f-258b2a70018d","year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:53.914447Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:e4cce096a1b4c5888c083589c8b16c1fa48796d8e4054f12a950aa7700364814","observation_id":"04b2de5d-2172-4ee4-baca-17c71b3a49fa","resolution":{"observed_at":"2026-08-07T13:24:55.380239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:24:54.021458Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.021458Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:bb3522fdf5e671132f9fb53b14c76997c6bd1dd8a65f63fae2cfbc196782deff","observation_id":"3ec533b4-47bb-425c-bc96-4f0808b4965f","resolution":{"observed_at":"2026-08-07T13:24:54.021458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:54.132125Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.132125Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:be659a485016465caa7f483382eb140c12c0c3f0d4cf8ab4c5524245abc52969","observation_id":"161fa363-a68a-42c3-8582-5de71460e329","resolution":{"observed_at":"2026-08-07T13:24:54.132125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-07T16:06:45.172290Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-07T13:24:54.235680Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.235680Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:9f9cde720bb305ce1163cc45f839ab25559f5da215251f852cb178ee424db240","observation_id":"512576cf-8bdd-4828-88db-3d113f7ce37f","resolution":{"observed_at":"2026-08-07T13:24:54.235680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-07T17:52:18.653123Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-08-07T13:24:54.345474Z","title":"Introducing visual perception token into multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.345474Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:c95d331f907d3d0e0eac0da54acb01bbce9d31cdbd5199b0cf08e542ed988982","observation_id":"59e799c9-745e-4f80-8775-79913f385c70","resolution":{"observed_at":"2026-08-07T13:24:54.345474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-07T13:24:54.427481Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.427481Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:a682bb83d44c4ea6043ad17bc643475a544c236cc6290c43f7cc899e9a6f8d6a","observation_id":"bdcf5e24-caf3-41f1-8888-177af150b37d","resolution":{"observed_at":"2026-08-07T13:24:54.427481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T13:24:54.491170Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.491170Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:ad54c221f5ac4e0cc23dbe3065ed843d1dabeed6d3b0da3d0d022a17d9cf8444","observation_id":"23622d0a-3561-49b8-9458-c3817c6b7f97","resolution":{"observed_at":"2026-08-07T13:24:54.491170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:54.566124Z","title":", \" * write output.state after.block = add.period write","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.566124Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:6306e47d1ea4bda961ad3b53de8a23aa2ee8d228551f32bcf1670772105017a2","observation_id":"7d0bfe84-fb56-4288-a145-74e854cc139d","resolution":{"observed_at":"2026-08-07T13:24:54.566124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:24:54.668238Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:54.668238Z"},"links":{"citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:a60b5c52d817c8ea5a9479446b729de663c4069ff737da5eb1119299f978b7ce","observation_id":"2d2679c0-1349-4812-9f51-95df8bf0e25d","resolution":{"observed_at":"2026-08-07T13:24:54.668238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 16 inbound Pith citation observations for arXiv:2505.22019."}