{"as_of":"2026-08-20T18:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95ee7dbb4b3e2f83250869b03c4aac654bbdb4dbc42af16631c2f4def0294cd9","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:12:42.179988Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01827/citation-record","integrity":"/paper/2608.01827/integrity","json":"/paper/2608.01827/citation-record.json","paper":"/paper/2608.01827"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-04T20:12:41.962725Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:41.962725Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:121c4a9550078e1ccbd71fddf067522d05465cce1010c9b243c521019d45856e","observation_id":"4d9423d4-4788-4748-bcd7-7a10b8702e81","resolution":{"observed_at":"2026-08-04T20:12:41.962725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:41.979882Z","title":"Zheng Chu, Xiao Wang, Jack Hong, Huiming Fan, Yuqi Huang, Yue Yang, Guohai Xu, Chenxiao Zhao, Cheng Xiang, Shengchao Hu, Dongdong Kuang, Ming Liu, Bing Qin, and Xing Yu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:41.979882Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:41d65d22e9ca39b651f1946e61efd6804adc894cad96694dbdceafb6a6e5ccf3","observation_id":"e050e9b1-1088-4e5b-83d6-b833a455c029","resolution":{"observed_at":"2026-08-04T20:12:41.979882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:41.984234Z","title":"Gheorghe Comanici, Eric Bieber, Mike Schaekermann, Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:41.984234Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:a4a0e60f08e60e83efca3811da973d415f4595f33f05774e5805ed3045bcae80","observation_id":"e5611415-cf2c-42f0-9d0d-4efdcea32deb","resolution":{"observed_at":"2026-08-04T20:12:41.984234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.31504","last_updated":"2026-06-30T11:22:24Z","snapshot_observed_at":"2026-08-12T18:44:43.168315Z","submitted_at":"2026-06-30T11:22:24Z","title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.31504","snapshot_observed_at":"2026-08-04T20:12:41.988764Z","title":"Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li, Jinyang Li, Wayne Xin Zhao, and Ji-Rong Wen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:41.988764Z"},"links":{"cited_paper":"/paper/2606.31504","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:be1cdec2a1253cde16196bea7b39f127635048656bd74b42fb02feb8a9925656","observation_id":"404f64ff-41f8-4f5a-9261-8719fb7b2936","resolution":{"observed_at":"2026-08-04T20:12:41.988764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12890","last_updated":"2026-04-25T02:32:57Z","snapshot_observed_at":"2026-08-11T09:04:45.578410Z","submitted_at":"2026-04-14T15:40:28Z","title":"Towards Long-horizon Agentic Multimodal Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12890","snapshot_observed_at":"2026-08-04T20:12:41.996482Z","title":"Mingyang Fu, Yuyang Peng, Dongping Chen, Zetong Zhou, Benlin Liu, Yao Wan, Zhou Zhao, Philip S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:41.996482Z"},"links":{"cited_paper":"/paper/2604.12890","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:b0f8e56720785df145f14a64be299718911a4c7ac143849879a04dc01573fc46","observation_id":"5d3d2c9c-c33d-4993-a093-7327a153f263","resolution":{"observed_at":"2026-08-04T20:12:41.996482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-12T15:21:22.765600Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-04T20:12:42.009030Z","title":"10 Preprint Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.009030Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:8631effeaa995300e9afe6fae0afc265a1e589e31aa32983fe44b4a62ef337d3","observation_id":"2d81ff00-6fa5-4cca-96d8-eb93c7f3c713","resolution":{"observed_at":"2026-08-04T20:12:42.009030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-04T20:12:42.013532Z","title":"Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, and Jianfei Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.013532Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:9e96ad8af8fd91f6006e8fae08ee9f2bc8b6daaa4beaeda8520ff35d389fe3d1","observation_id":"892b84f0-d8ab-4bc6-98c6-616c36a5c3f2","resolution":{"observed_at":"2026-08-04T20:12:42.013532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.018412Z","title":"Aaron Hurst, Adam Lerer, Adam P Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Os- trow, Akila Welihinda, Alan Hayes, Alec Radford, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.018412Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:d2ae4a07985b58fcdf632a762f6cc9d1bb14e05d6ab1bf1035741526b6da9f47","observation_id":"bb88e0b0-1e4e-44b2-98c6-c2d4f191009a","resolution":{"observed_at":"2026-08-04T20:12:42.018412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T20:12:42.024196Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.024196Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:93af35e5b029ef8759f10f00c2b4ac452aa79987bd4cd55f3c8d29182a83d951","observation_id":"9d769d97-c830-4c32-9063-622e16ff2eb6","resolution":{"observed_at":"2026-08-04T20:12:42.024196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.029575Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.029575Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:3946cd10c58a66cd3160f42f5fc36636decbefb566717f763817899c219e2885","observation_id":"88633362-19b6-4208-a7c2-7f1537111056","resolution":{"observed_at":"2026-08-04T20:12:42.029575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T20:12:42.042253Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.042253Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:1ea1e7cfd8e1286fc3b3f449c164424dcd6823b9642753817c4b5e95997680f7","observation_id":"feac6c70-0f00-45e4-b784-912a931ab08c","resolution":{"observed_at":"2026-08-04T20:12:42.042253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14029","snapshot_observed_at":"2026-08-04T20:12:42.052599Z","title":"11 Preprint Kartik Narayan, Yang Xu, Tian Cao, Kavya Nerella, Vishal M Patel, Navid Shiee, Peter Grasch, Chao Jia, Yinfei Yang, and Zhe Gan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.052599Z"},"links":{"cited_paper":"/paper/2604.14029","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:eb2633ba9e0a639b42e45cada707cc0fec905999cc41fc2d56a0e8d38594475d","observation_id":"217f99a1-192d-44ee-8159-68ca65c503c5","resolution":{"observed_at":"2026-08-04T20:12:42.052599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T20:12:42.060852Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.060852Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:ebbc8d778ff3c109685b0cfd749ded3e7bf4c1f40be4e787c1c63f6297159cb3","observation_id":"78506f83-5591-4135-b590-5f2c44410972","resolution":{"observed_at":"2026-08-04T20:12:42.060852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-08-15T21:58:54.708977Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-04T20:12:42.068290Z","title":"Pixel reasoner: In- centivizing pixel-space reasoning with curiosity-driven reinforcement learning.arXiv preprint arXiv:2505.15966, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.068290Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:fb279cc719a73553b4520eec8ea8e81bc3a62587c9a733bb9d502b4fd3875fdf","observation_id":"c6f67419-a36b-467b-932f-d306dfc57dd5","resolution":{"observed_at":"2026-08-04T20:12:42.068290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.076462Z","title":"Tongyi DeepResearch Team, Baixuan Li, Bo Zhang, Dingchu Zhang, Fei Huang, Guangyu Li, Guoxin Chen, Huifeng Yin, Jialong Wu, Jingren Zhou, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.076462Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:9a011f0b8dee8829e52bc62554ae894340244082fc7eff8e9e9037fd33175004","observation_id":"60386b90-9290-4f6e-8d2c-e07f6bae7f20","resolution":{"observed_at":"2026-08-04T20:12:42.076462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-04T20:12:42.082147Z","title":"Jialong Wu, Baixuan Li, Runnan Fang, Wenbiao Yin, Liwen Zhang, Zhenglin Wang, Zhengwei Tao, Ding-Chu Zhang, Zekun Xi, Robert Tang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.082147Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:56f24b7e1bdf46a2617a43199a18cc6381ea0708d53a78e43710b2700d2ada52","observation_id":"26b77e54-b248-46cf-9d65-ccf3a1e0ae6b","resolution":{"observed_at":"2026-08-04T20:12:42.082147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-08-14T00:24:35.202988Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-08-04T20:12:42.088950Z","title":"Huanjin Yao, Qixiang Yin, Min Yang, Ziwang Zhao, Yibo Wang, Haotian Luo, Jingyi Zhang, and Jiaxing Huang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.088950Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:5a46c2fe6d392f061187ea13db42a428465fe9f338d34f98e19b7495fc5a0ad5","observation_id":"496c2b04-519a-410b-9bee-1d53c9b93c69","resolution":{"observed_at":"2026-08-04T20:12:42.088950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.095785Z","title":"Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, and Yuan Cao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.095785Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:7ed9fa3a898197eadc3276ea0f200711f750e92f3990f78fca059996fd472e3a","observation_id":"fa6b4dde-14c5-4823-a456-ff72a02ffb29","resolution":{"observed_at":"2026-08-04T20:12:42.095785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02259","snapshot_observed_at":"2026-08-04T20:12:42.111366Z","title":"Memagent: Reshaping long-context llm with multi-conv rl-based memory agent.arXiv preprint arXiv:2507.02259,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.111366Z"},"links":{"cited_paper":"/paper/2507.02259","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:60b169f532bf12b9bc4476dca0c56cb88da067d5e761cae50bc09ee4e5112138","observation_id":"b97f5b84-3a10-4487-8d11-1ccfe8c83459","resolution":{"observed_at":"2026-08-04T20:12:42.111366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-13T17:45:25.269133Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-04T20:12:42.116439Z","title":"Visrag: Vision-based retrieval-augmented generation on multi- modality documents.arXiv preprint arXiv:2410.10594,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.116439Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:46b184ee448323cd923c115475f5faf95195d0fbbbc41df4c599bd90b6857739","observation_id":"953d8c11-78f8-452f-a89b-5affbb36be52","resolution":{"observed_at":"2026-08-04T20:12:42.116439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.125011Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.125011Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:fa785b5f7f03d88b1c6af8c7d73db39e7b938db4a6700f1c5cea7c6c68608c68","observation_id":"a559008a-7990-43ca-9ece-188a1c14b0eb","resolution":{"observed_at":"2026-08-04T20:12:42.125011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-04T20:12:42.129749Z","title":"thinking with images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.129749Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:3db516a6db1dc2eb386135351f82df2a6117497cbfe0524d1eb59870762d585f","observation_id":"b1f9324f-97e0-4bb1-bd87-a96daf0d96a2","resolution":{"observed_at":"2026-08-04T20:12:42.129749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T20:12:42.138153Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.138153Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:edbdd3192469800bb185f61708b4ceb948bcff58c82ccdc3fc52c878ca9547d7","observation_id":"0a86ef83-6427-40a2-ab72-ed33acf8bd9a","resolution":{"observed_at":"2026-08-04T20:12:42.138153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.144421Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.144421Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:c727d3c8639324f30d61278cc85761dc2c9557970f285e217617b5968cbf18ec","observation_id":"0f5b9001-aa67-4fb9-94f1-0b23653c353c","resolution":{"observed_at":"2026-08-04T20:12:42.144421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.150086Z","title":"In parallel, the available operations have expanded from fixed crops to code-synthesized image trans- formations (Zhao et al., 2025; Zhang et al., 2025a)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.150086Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:c7346690fa37db0c88826917d419e64e3db50ea8d2ae9435fcd7ef8280d25446","observation_id":"e83234b5-0a63-4d5d-bdcb-f107f9dc3af2","resolution":{"observed_at":"2026-08-04T20:12:42.150086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.155917Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.155917Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:0414d28ca4a73921a146d1c7760fa151e2293d9ee2ba67e1e865bd02ecb28e26","observation_id":"44ec025f-dec5-470e-8227-262cfedc490b","resolution":{"observed_at":"2026-08-04T20:12:42.155917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.161611Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.161611Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:0e8fa7158228cbf3e533a84a8747a67e99e619f55e67dfc45475efb0cb3e8244","observation_id":"62850fa8-88c1-44b1-8bb6-2b94b4176514","resolution":{"observed_at":"2026-08-04T20:12:42.161611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.166791Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.166791Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:364f0db0779f299fdcbe764c46ae62b9c64a41cc5ce9616ce71a609512bf73a1","observation_id":"be2a69e2-1ee4-4758-81d8-900bf5393443","resolution":{"observed_at":"2026-08-04T20:12:42.166791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.174223Z","title":"This improves the placement of input-side visual grounding, but the image still substitutes for a node in a reasoning chain that was constructed in text","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.174223Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:69a691ec0057c87f6888e5fa12f800d56ab881dd17e09c92259b52819e826731","observation_id":"f4ef8492-b1b0-4011-83e5-8241e1e754bd","resolution":{"observed_at":"2026-08-04T20:12:42.174223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.179988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.179988Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:6b43e2e9cf8dd40b55845f3e8549e19365c8e1c90034a3be28888b699273fadb","observation_id":"928e62f2-d364-4e78-807d-505078971c75","resolution":{"observed_at":"2026-08-04T20:12:42.179988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-04T20:12:42.036366Z","title":"Mini-o3: Scaling up reasoning patterns and interaction turns for visual search.arXiv preprint arXiv:2509.07969,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.036366Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:75222fd6c85413dd5106064b1786d2509f502e220166f934e197dd9dcaa5b9a1","observation_id":"a80f6a26-000f-463e-8577-c0dcf86fb309","resolution":{"observed_at":"2026-08-04T20:12:42.036366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:41.975027Z","title":"Glyph: Scaling context windows via visual-text compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:41.975027Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:6d9206ca18223be72e6426c5fb42a08b2a594985e990c7a82778ed701b4499f0","observation_id":"062a7e2f-f049-4c64-a1ea-56af2d26a6a0","resolution":{"observed_at":"2026-08-04T20:12:41.975027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:12:42.105883Z","title":"Agentfold: Long-horizon web agents with proactive context management.arXiv preprint arXiv:2510.24699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.105883Z"},"links":{"citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:16804e660f59f7f1b8f51cee42d2a203e452b571295f49a16243a930a6f87d78","observation_id":"8f8d441d-ba36-4b04-b600-f5ff5f4fd9b4","resolution":{"observed_at":"2026-08-04T20:12:42.105883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-12T16:37:55.786203Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-04T20:12:42.046835Z","title":"Websailor: Navigating super-human reasoning for web agent.arXiv preprint arXiv:2507.02592, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.046835Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:afc20f12bfa5ece861c6dda0aa1f11350755594ec905d4efb325cc5135920d73","observation_id":"2483c9bf-2a8b-4e58-8a2f-887094768af8","resolution":{"observed_at":"2026-08-04T20:12:42.046835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05288","last_updated":"2025-07-01T02:17:31Z","snapshot_observed_at":"2026-08-20T04:16:59.609095Z","submitted_at":"2025-04-07T17:39:31Z","title":"Seeking and Updating with Live Visual Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05288","snapshot_observed_at":"2026-08-04T20:12:42.003038Z","title":"Xinyu Geng, Peng Xia, Zhen Zhang, Xinyu Wang, Qiuchen Wang, Ruixue Ding, Chenxi Wang, Jialong Wu, Yida Zhao, Kuan Li, Yong Jiang, Pengjun Xie, Fei Huang, and Jingren Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.003038Z"},"links":{"cited_paper":"/paper/2504.05288","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:2ba5d1aab6c3db69830f22e07275fa598e9e270d3f45da1b8faf2aafc5081b70","observation_id":"253414bc-4f8e-4eae-9edf-9ee0c0376758","resolution":{"observed_at":"2026-08-04T20:12:42.003038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05185","last_updated":"2026-05-06T17:50:38Z","snapshot_observed_at":"2026-08-15T09:59:46.688587Z","submitted_at":"2026-05-06T17:50:38Z","title":"OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05185","snapshot_observed_at":"2026-08-04T20:12:41.969149Z","title":"Wenhu Chen, Hexiang Hu, Xi Chen, Pat Verga, and William W Cohen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:41.969149Z"},"links":{"cited_paper":"/paper/2605.05185","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:1e233e74bbcc241cfe388ff15af937225769b6b83cfb706788bbf0fc768adb73","observation_id":"056490da-a8f0-40c0-8548-b938139922aa","resolution":{"observed_at":"2026-08-04T20:12:41.969149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:21:35.596894Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.01827."}