{"as_of":"2026-08-17T00:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a25f85134aeac22107ffa0f915fa795456420999da9331723a56209b7ef20121","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:33.223922Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:04:19.981518Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-16T05:04:19.981518Z","title":"Visual agentic reinforcement fine-tuning.arXiv preprint arXiv:2505.14246, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21561","last_updated":"2026-06-11T07:05:17Z","snapshot_observed_at":"2026-08-16T20:05:21.982208Z","submitted_at":"2025-04-30T12:01:27Z","title":"Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:04:19.981518Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2504.21561"},"observation_digest":"sha256:318d6935a69570056055b793476e0c13b72eda3775cb399dd2ff28908778e360","observation_id":"c725d446-5861-48db-920f-891c115909de","resolution":{"observed_at":"2026-08-16T05:04:19.981518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-06T13:23:31.664819Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-14T23:16:41.496277Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:31.664819Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:117a1243100612578a71a87180d03492f040a42d6b8d4572d2b9e959b335704f","observation_id":"cb7f07b1-1c5e-410c-aafa-bf50b790308d","resolution":{"observed_at":"2026-08-06T13:23:31.664819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T22:51:58.986937Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-11T18:36:06.277440Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T22:51:58.986937Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:96d7f9cac39d19c69d44439d93456d2ec333ac5e1f13909e8c0802b1e68765dd","observation_id":"9a1e24f4-4d32-4e6b-a632-3a1e3806b222","resolution":{"observed_at":"2026-08-05T22:51:58.986937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T11:56:37.737420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02164","last_updated":"2025-09-02T10:14:55Z","snapshot_observed_at":"2026-08-07T04:11:09.551801Z","submitted_at":"2025-09-02T10:14:55Z","title":"Omnidirectional Spatial Modeling from Correlated Panoramas","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:37.737420Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2509.02164"},"observation_digest":"sha256:dfd62435c057240df00c0ce10ca9705f9b4bdbb16e63ad5fb396bd69fea411d6","observation_id":"fc79799a-110e-4fd8-acd1-67023cab6372","resolution":{"observed_at":"2026-08-05T11:56:37.737420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:8de1c557d1c98df69dd436ca194704721c231976c38ee4033de7f3b8d63a72ed","observation_id":"033251b8-d0f4-498b-abd8-e5eb35679d80","resolution":{"observed_at":"2026-05-16T05:32:29.373295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2512.16300","last_updated":"2026-07-22T08:44:48Z","snapshot_observed_at":"2026-08-15T04:26:57.591996Z","submitted_at":"2025-12-18T08:38:44Z","title":"Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T21:39:46.031368Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2512.16300"},"observation_digest":"sha256:99bba248ab046574ab78e50172daa4e2a10f20f61a832bc3ee84ee66d77be484","observation_id":"af55a94a-d81b-49c0-9995-b46ac10f79fc","resolution":{"observed_at":"2026-05-16T21:41:17.900369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-03T15:38:29.010684Z","title":"Visual agentic reinforcement fine-tuning.arXiv preprint arXiv:2505.14246, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16300","last_updated":"2026-07-22T08:44:48Z","snapshot_observed_at":"2026-08-15T04:26:57.591996Z","submitted_at":"2025-12-18T08:38:44Z","title":"Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T15:38:29.010684Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2512.16300"},"observation_digest":"sha256:55e879b084c536e5e195ce95271b82f308e5e999c3d722e5196bbb36f00aeccb","observation_id":"2525a52f-b6e8-40ab-afff-3cafdedbf85a","resolution":{"observed_at":"2026-08-03T15:38:29.010684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2604.02794","last_updated":"2026-04-03T07:02:13Z","snapshot_observed_at":"2026-08-14T22:09:57.232885Z","submitted_at":"2026-04-03T07:02:13Z","title":"CharTool: Tool-Integrated Visual Reasoning for Chart Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T20:07:23.153064Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.02794"},"observation_digest":"sha256:6ae7ad6c217e4b7e80ad4bca266dc3f972cf8db2398ce98b4ab168044468e867","observation_id":"db3d9f0f-b51b-4689-8a98-9c83b448bdbe","resolution":{"observed_at":"2026-05-13T20:08:12.704592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2604.09508","last_updated":"2026-04-10T17:25:34Z","snapshot_observed_at":"2026-08-11T19:13:50.264942Z","submitted_at":"2026-04-10T17:25:34Z","title":"VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:21.088097Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.09508"},"observation_digest":"sha256:aa1a305465a60650b85b119de3c95b138f2896a95179de1f13340b71809e1005","observation_id":"f0b57e88-2868-4f54-b756-d5bfd82a6cf8","resolution":{"observed_at":"2026-05-11T06:11:03.346715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:24.304696Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:e15eb599c1f6be29e80196128f67388aa9b9bbaf8c2a98656d02062b95c73de2","observation_id":"323e38f1-cf64-4873-8596-f0686381a9a1","resolution":{"observed_at":"2026-05-10T13:10:26.341662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-02T16:18:22.349123Z","title":"arXiv preprint arXiv:2505.14246 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:22.349123Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:7f94b18b1b1c7a77d09eb98aecf1eeb85eda9a446104b791325edc01a3e0ebbd","observation_id":"d9d59b1f-9f42-4f44-a64c-754c24f77a8b","resolution":{"observed_at":"2026-08-02T16:18:22.349123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-08-14T06:53:31.710132Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:e34189da679d3d93ca03d727bf3dcd86512df3f7fa935c10e430bad49709a3cc","observation_id":"f541607c-fd75-4ef7-a8e9-acc00711daba","resolution":{"observed_at":"2026-05-10T12:10:22.151356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2604.19857","last_updated":"2026-04-21T17:21:08Z","snapshot_observed_at":"2026-08-15T12:41:20.820860Z","submitted_at":"2026-04-21T17:21:08Z","title":"Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T03:14:04.535856Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.19857"},"observation_digest":"sha256:9874fdf1f4764748e0b5d6496dd94d067e4e6b874606fd7d4342e4be179eb671","observation_id":"e2ea8c18-56ec-4367-b21d-c097e4887d49","resolution":{"observed_at":"2026-05-10T03:14:07.166393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-07-12T18:39:55.906516Z","title":"Visual agentic reinforcement fine-tuning.arXiv preprint arXiv:2505.14246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.21405","last_updated":"2026-07-08T08:18:54Z","snapshot_observed_at":"2026-08-15T06:17:19.700572Z","submitted_at":"2026-04-23T08:20:42Z","title":"Supermassive Black Hole Winds in X-rays: SUBWAYS IV. Tracing Radio Emission and Unveiling the Role of Winds","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T18:39:55.906516Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.21405"},"observation_digest":"sha256:09b60e625609d0349bb431f810a9c6ae3c389e13d383d07f6d66e28c9f3cc7a7","observation_id":"dd30d3a7-b8fa-48d7-a4c5-4859b3c4b05f","resolution":{"observed_at":"2026-07-12T18:39:55.906516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2604.21409","last_updated":"2026-04-23T08:23:25Z","snapshot_observed_at":"2026-08-11T17:11:51.630473Z","submitted_at":"2026-04-23T08:23:25Z","title":"S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T22:26:03.080281Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2604.21409"},"observation_digest":"sha256:c7761ab5dc779d6a943835da446fd4df14ae52568bda2eedfdcd7399545ab5ec","observation_id":"0538cd5a-9582-484b-99b4-99161069ed6e","resolution":{"observed_at":"2026-05-09T22:34:07.576598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2605.02730","last_updated":"2026-05-04T15:31:11Z","snapshot_observed_at":"2026-08-02T14:48:33.210016Z","submitted_at":"2026-05-04T15:31:11Z","title":"Perceptual Flow Network for Visually Grounded Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T18:40:55.753827Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2605.02730"},"observation_digest":"sha256:5125ea31a45bdbceb0d30c708a3aaa235a3b90045cd099a8cdd1db096f254ee2","observation_id":"6c77e42a-913e-4405-98e4-2bfc083b8fdb","resolution":{"observed_at":"2026-05-09T06:15:38.959109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2605.09860","last_updated":"2026-05-20T01:53:04Z","snapshot_observed_at":"2026-08-15T00:01:02.564854Z","submitted_at":"2026-05-11T01:43:13Z","title":"When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:58:21.232058Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2605.09860"},"observation_digest":"sha256:6b3634e7dd1ecd90e714d4d0b5afe54dd4789786beed675c078d9ea935f896ce","observation_id":"3a11aa03-4cac-476a-bbe5-0930825189ef","resolution":{"observed_at":"2026-05-12T05:46:28.537742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2605.09860","last_updated":"2026-05-20T01:53:04Z","snapshot_observed_at":"2026-08-15T00:01:02.564854Z","submitted_at":"2026-05-11T01:43:13Z","title":"When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T23:23:14.695568Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2605.09860"},"observation_digest":"sha256:81ef8b987a11d1f0c99bdc8b636fe032b55dcea99126c5c499e7db35569cf73f","observation_id":"ebb3ff76-1be6-49dd-b1f3-dad5b93d9c85","resolution":{"observed_at":"2026-05-20T23:23:50.999336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2605.09860","last_updated":"2026-05-20T01:53:04Z","snapshot_observed_at":"2026-08-15T00:01:02.564854Z","submitted_at":"2026-05-11T01:43:13Z","title":"When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T08:33:24.285225Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2605.09860"},"observation_digest":"sha256:f1547b04bda52b0c6f72a058c381b8677ae91757068d1ce412a0d83d07f53eed","observation_id":"334ef447-a13b-44cc-bf05-0d65216b2be4","resolution":{"observed_at":"2026-05-21T08:34:05.177105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2605.15792","last_updated":"2026-05-15T09:48:46Z","snapshot_observed_at":"2026-08-08T03:23:41.035935Z","submitted_at":"2026-05-15T09:48:46Z","title":"Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T18:44:54.835575Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2605.15792"},"observation_digest":"sha256:02a1d5fa2ce1844112c09431c9ce43fdb9a2760386d84ffdbe4909c906bb189d","observation_id":"bdd92be5-3bf5-4e97-be2e-a068244c8510","resolution":{"observed_at":"2026-05-20T18:48:53.501567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2605.22177","last_updated":"2026-05-21T08:47:49Z","snapshot_observed_at":"2026-08-02T13:10:19.838403Z","submitted_at":"2026-05-21T08:47:49Z","title":"Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T07:51:13.362986Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2605.22177"},"observation_digest":"sha256:405891d6e4198db42060ad4ad8cbb2470fb7b58be9319aaa366327f88b73dfb6","observation_id":"65fa70b1-12b0-4109-a82a-808d652b119b","resolution":{"observed_at":"2026-05-22T07:51:15.344041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2606.05784","last_updated":"2026-06-04T07:15:43Z","snapshot_observed_at":"2026-08-13T17:59:14.205687Z","submitted_at":"2026-06-04T07:15:43Z","title":"TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:11.638029Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2606.05784"},"observation_digest":"sha256:968637f26e0d06ee57fbd02a93dcbe2da8fa36b36ad260189330f03c5aefca9f","observation_id":"dd367bf8-6560-4f72-be9f-de5dd70f0b21","resolution":{"observed_at":"2026-07-02T12:16:57.757158Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2606.15932","last_updated":"2026-06-16T15:28:03Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T17:21:43Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T03:57:19.028507Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2606.15932"},"observation_digest":"sha256:1e5593b6e1259fc2ec7699765baebaf447c401fd26eeed6cec454017f6bab02e","observation_id":"b9c26ddd-41bb-49fc-b1fe-b9f03bffa7a2","resolution":{"observed_at":"2026-07-03T17:38:44.161925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.14246","doi":"10.48550/arxiv.2505.14246","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual agentic reinforcement fine-tuning","venue":"ArXiv.org","work_id":"1eea1136-18fb-4c77-b935-b8c3f9d025db","year":2025},"citing_paper":{"arxiv_id":"2606.31504","last_updated":"2026-06-30T11:22:24Z","snapshot_observed_at":"2026-08-12T18:44:43.168315Z","submitted_at":"2026-06-30T11:22:24Z","title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-01T06:02:48.532478Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2606.31504"},"observation_digest":"sha256:137dae52525a52d6f7aec60e28158d91bb7c7aa8e1e8f407e7231b7a4a15f4f5","observation_id":"316a23a1-8827-4d56-ae2d-b7e8349b24dd","resolution":{"observed_at":"2026-07-01T09:55:41.099651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-07-12T06:04:16.637378Z","title":"Visual agentic reinforcement fine-tuning.arXiv preprint arXiv:2505.14246, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02927","last_updated":"2026-07-03T03:50:09Z","snapshot_observed_at":"2026-08-07T23:48:33.179767Z","submitted_at":"2026-07-03T03:50:09Z","title":"VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T06:04:16.637378Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2607.02927"},"observation_digest":"sha256:49880dac99c2e9de04e00c91e57004b5763a7174f3cc531841c6076e031af67b","observation_id":"73392426-f97a-43ea-962c-b5d9e7e16716","resolution":{"observed_at":"2026-07-12T06:04:16.637378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14246","snapshot_observed_at":"2026-08-12T20:43:53.071368Z","title":"arXiv:2505.14246 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T23:10:59.215042Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:53.071368Z"},"links":{"cited_paper":"/paper/2505.14246","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:334a83942e855580650d5a8a3d8423ab4d352589797382a6e67be27d5e833836","observation_id":"656c0542-960e-4728-9f4c-95f14bf59551","resolution":{"observed_at":"2026-08-12T20:43:53.071368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14246/citation-record","integrity":"/paper/2505.14246/integrity","json":"/paper/2505.14246/citation-record.json","paper":"/paper/2505.14246"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:42:25.774074Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.774074Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:49647d56969312c86b55c2154a23b8ebb350999308afeef25ee2b543a2f3eaa9","observation_id":"eba71093-4b50-4a74-be73-6e6aa8a27e7a","resolution":{"observed_at":"2026-08-07T15:42:25.774074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-08-10T03:47:52.773511Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-07T15:42:25.832792Z","title":"Learning to reason with search for llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.832792Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:de1f3a34306f98da88243b1951274e425d671e8219617e72c363058c72d1a31b","observation_id":"37f415e6-f94f-4cfc-84e7-0dc74aefcce8","resolution":{"observed_at":"2026-08-07T15:42:25.832792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:42:25.897449Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.897449Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:7b5c9019d923055b5caeb5f41a608364556e98fa1bfef814dcc7c06ca882c6cf","observation_id":"1bb37353-e8cb-4ac9-86bc-d6b8d4ebf0d1","resolution":{"observed_at":"2026-08-07T15:42:25.897449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.968524Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.968524Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:bb4b49de9c64c2013973d07f73541a3cbbea074db77bb002692866ef6bf56a3c","observation_id":"4ff072ad-0201-483e-acca-62a01329f947","resolution":{"observed_at":"2026-08-07T15:42:25.968524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-07T15:42:26.032221Z","title":"Retool: Reinforcement learning for strategic tool use in llms.arXiv preprint arXiv:2504.11536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.032221Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:7583ca06687f7b868d12b2711b6b735b64af9e85ca9143cf6ebef900136395e8","observation_id":"6a7e0fa7-6b81-4ec4-b3ee-2b234a43114f","resolution":{"observed_at":"2026-08-07T15:42:26.032221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-07T15:42:26.090406Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning.arXiv preprint arXiv:2501.00321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.090406Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:6e729a997ddb3be1e69c2fff7c41b758163cf124dc0ab51b97074728ba9d99f4","observation_id":"56f9d6cb-eb9e-4cb4-b5de-f05489c2026f","resolution":{"observed_at":"2026-08-07T15:42:26.090406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-16T12:43:30.161882Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-07T15:42:26.151443Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use.arXiv preprint arXiv:2504.04736, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.151443Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:772c449a36ff2a8ec2918594bf6edb53fac4aac3de5540249394af5c18bf3b07","observation_id":"a6bd3552-31f0-4518-b16d-d01d8f677910","resolution":{"observed_at":"2026-08-07T15:42:26.151443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:42:26.221489Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.221489Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:8c0e2347e6eb79ce32891d09e4091d34b8a3315965d6661f6014a7e7f6f6a325","observation_id":"98273d02-832c-49ac-a4d8-b0b721538a11","resolution":{"observed_at":"2026-08-07T15:42:26.221489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-08-14T05:50:17.249446Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-07T15:42:26.224356Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps.arXiv preprint arXiv:2011.01060, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.224356Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:64919b856b45daeb4d32919eefe444a68761eac29d1645457a58dea9a3879e2f","observation_id":"9a671e0c-9e19-4301-8e17-06234cd5b2c1","resolution":{"observed_at":"2026-08-07T15:42:26.224356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:42:26.252123Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.252123Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:b1d770d22068494f6ab8f009da3be055d1e9c58b0ba8a09699ede8edc8ee8b10","observation_id":"dd2e3d2b-80fb-4e34-b9f7-f70395ea796c","resolution":{"observed_at":"2026-08-07T15:42:26.252123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T15:42:26.389486Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.389486Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:3de383a71cfdd1003ab47f9dc2e6d4c20904b34b8cee4d552c38d8f792b8609a","observation_id":"c5eef7de-a9df-42d2-ac17-2866a3206a6f","resolution":{"observed_at":"2026-08-07T15:42:26.389486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.543623Z","title":"Funsd: A dataset for form understand- ing in noisy scanned documents","venue":null,"work_id":"79ced226-99dd-4fbc-8d49-1cbb9afd4608","year":2019},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.593418Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:0278f0073807fcf489f184006dd916de6454e03c4b6d20273fe905de6ee43ccf","observation_id":"1798631c-9641-43b4-913d-6c8f4b0fbb2f","resolution":{"observed_at":"2026-08-07T15:42:35.636112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T15:42:26.854529Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.854529Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:1c227ed4539e262ef6368b34f390495743f64f90e8c21081a7b771b5e9655b99","observation_id":"2d898de4-7829-41e0-a13d-1c5972db8f41","resolution":{"observed_at":"2026-08-07T15:42:26.854529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.312413Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":"d9c9c585-a4ac-449b-a8cf-f00e7febbbb3","year":2017},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.990009Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:3357f3c81b7cc4430e4726d21692b8ee69c569a7f456c12fd0d16394a6b449e5","observation_id":"03f2efd7-faa7-46c1-8941-40ac41b53eaa","resolution":{"observed_at":"2026-08-07T15:42:35.419369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T15:42:27.137332Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.137332Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:49bb7bad2e80a31a275e66136e97d78ddac160619bc13b802c364878e78bc8d9","observation_id":"ec2396d2-1747-4864-a0aa-8cf966d3235c","resolution":{"observed_at":"2026-08-07T15:42:27.137332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:42:27.314659Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.314659Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:8969bcb8fc06e2afc55f29a010b005fff98ba4e840eee80628b2984617799a95","observation_id":"9f8120d5-6b86-41c8-9671-7af117e0f4ff","resolution":{"observed_at":"2026-08-07T15:42:27.314659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:42:27.491865Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.491865Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:a0393317d74799e6a3357a21e4e4a3e933d97dd8c995bf54f7a84d4d6818e520","observation_id":"12cec2a7-abdf-4484-a537-a7d49576ec7a","resolution":{"observed_at":"2026-08-07T15:42:27.491865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-08-15T17:19:59.096854Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-07T15:42:27.569008Z","title":"Search-o1: Agentic search-enhanced large reasoning models.arXiv preprint arXiv:2501.05366, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.569008Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:8931340f5f3f8be947621f72d065b2204c2b8f4320079b3ef28625bc30e21edf","observation_id":"81bd1770-9f80-471c-8d42-e52cec76a3c7","resolution":{"observed_at":"2026-08-07T15:42:27.569008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21776","snapshot_observed_at":"2026-08-07T15:42:27.647588Z","title":"Webthinker: Empowering large reasoning models with deep research capability.arXiv preprint arXiv:2504.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.647588Z"},"links":{"cited_paper":"/paper/2504.21776","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:429a57cb3118f130dd5ff3e8f7ca6027cded42dd59aebf2510c8c8da81e0ae17","observation_id":"2b789c3e-1a87-4ba0-9b5e-9ad6d8fe20ba","resolution":{"observed_at":"2026-08-07T15:42:27.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-16T12:45:37.860056Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T15:42:27.826306Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.826306Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:72096da0cac7eb7ec3000be96bbf9121e985740aca2c71af0f8023599f272579","observation_id":"242dc923-cbeb-4a5f-93d5-edf32159a6d5","resolution":{"observed_at":"2026-08-07T15:42:27.826306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-08-16T14:27:12.827551Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-08-07T15:42:28.012611Z","title":"Mario: Math reasoning with code interpreter output–a reproducible pipeline.arXiv preprint arXiv:2401.08190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:28.012611Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:b2b8742c9ba07733bd7f1330b6f944f7830cf92824cad43c8cdcec00090f2630","observation_id":"c66baf67-60d2-40f6-a412-24e70996a822","resolution":{"observed_at":"2026-08-07T15:42:28.012611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:42:28.137316Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:28.137316Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:f7896206e0a57e1f0999703fb0713a9c9297363f6ff5a17eada3fba34be72022","observation_id":"2a16924f-b1dc-4240-b031-a515a10c3bdc","resolution":{"observed_at":"2026-08-07T15:42:28.137316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T15:42:28.278760Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms.arXiv preprint arXiv:2410.18451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:28.278760Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:39a5aa7094a05c827dc428bb436daecef44b03b09ba0730f42c991aa6eb1b344","observation_id":"655ed0a7-707f-4fc9-9dcb-7c24f1f07623","resolution":{"observed_at":"2026-08-07T15:42:28.278760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.501618Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:28.501618Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:aac48aa64816e410c6c1bff93253ee7427b8610f0aef6d897fec494fcca403a8","observation_id":"85a39c18-1c3e-4050-910b-f8a60a7772db","resolution":{"observed_at":"2026-08-07T15:42:28.501618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-14T21:12:00.450049Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T15:42:28.688036Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:28.688036Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:219c887853085abc306b4dbc3c0dbd61ebe927525f11787431d1d7326f045db9","observation_id":"4c6df9bf-e8c5-4462-9379-efda43819b88","resolution":{"observed_at":"2026-08-07T15:42:28.688036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17637","last_updated":"2024-10-23T07:56:48Z","snapshot_observed_at":"2026-08-16T13:06:43.966520Z","submitted_at":"2024-10-23T07:56:48Z","title":"MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17637","snapshot_observed_at":"2026-08-07T15:42:28.862738Z","title":"Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models.arXiv preprint arXiv:2410.17637, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:28.862738Z"},"links":{"cited_paper":"/paper/2410.17637","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:6e9b4d3578fb337e53735973fcc0cc061813f373f4079ec925b29e16f5d78237","observation_id":"15e7b348-2b4a-49ad-843b-126a7805723d","resolution":{"observed_at":"2026-08-07T15:42:28.862738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.067119Z","title":"Towards end-to-end unified scene text detection and layout analysis","venue":null,"work_id":"ee13b924-317e-435e-85f8-75d365a21fa5","year":2022},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:28.982324Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:a5e7d9a73ec8144338472e8be551343d63e6572dc53b8343e903af14b8bcd1ad","observation_id":"1f32866b-9bd4-4725-8eee-ecdd2497a2a1","resolution":{"observed_at":"2026-08-07T15:42:35.148871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.180856Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:29.180856Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:86db7bf50eb47b1f75a6d8c0669694f7cd73ddc46592e66606eea4575ee05923","observation_id":"f83f97ba-dff6-4823-ac40-8ae1fdb0b1d1","resolution":{"observed_at":"2026-08-07T15:42:29.180856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.914448Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"e3318d1e-9b0c-402e-bb9f-96e0107a00fc","year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:29.364570Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:bb244fe51641db37bb4ed17303022ab2f112c47cb411128ffe84494173966f25","observation_id":"1d5d6c53-b62d-4137-8bec-5b29142bfd59","resolution":{"observed_at":"2026-08-07T15:42:34.960007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.490479Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:29.490479Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:0c0f0b7840a14ffcd9a81b947a6ec2d330dacabd09d59e4be9797a9e887baddf","observation_id":"130f2762-e4b3-426d-83ae-f092012e2668","resolution":{"observed_at":"2026-08-07T15:42:29.490479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.594694Z","title":"Gorilla: Large language model connected with massive apis.Advances in Neural Information Processing Systems, 37:126544–126565, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:29.594694Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:e1afc630399f711f48adc7081f9bde074397d59bf3be713b10dd348eee07113e","observation_id":"fa4980e5-7038-4d89-a2dc-b53568a92cef","resolution":{"observed_at":"2026-08-07T15:42:29.594694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-08-15T17:25:43.175408Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-07T15:42:29.745789Z","title":"Measuring and narrowing the compositionality gap in language models.arXiv preprint arXiv:2210.03350, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:29.745789Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:19bd5e9539e029fd1f86bc4d345ae1d419b89fab2ba0295e5a30d8118bd21da6","observation_id":"45b2f3a3-8c62-4438-b0d9-28ac5ba784e9","resolution":{"observed_at":"2026-08-07T15:42:29.745789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T15:42:29.872210Z","title":"Toolrl: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:29.872210Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:833a33eb6994571156853e02dc058f1096ce4ded67f11ba12bff396b9b3c3993","observation_id":"28131c6f-787c-48c0-993b-cf351e59a231","resolution":{"observed_at":"2026-08-07T15:42:29.872210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.987599Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:29.987599Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:b0f4ad9404a7f8b2e9761e03f28d4ecddd6769bd235a72fc6b69408a1a980047","observation_id":"552cfcd0-d140-4f3c-927d-4e9fc3ff7cff","resolution":{"observed_at":"2026-08-07T15:42:29.987599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:42:30.145090Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:30.145090Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:905f0db34b35945962f413dfe7e71bdfd836ff029d45796609370194eb5c5138","observation_id":"d762b09c-88dd-4453-afd5-5fa0a8d0630a","resolution":{"observed_at":"2026-08-07T15:42:30.145090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:42:30.233899Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:30.233899Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:7c01869cd4369bf1ff4699083364770d41b9a02cc257eb63572ef790bd38e433","observation_id":"66484908-b300-4c1e-b938-d291a55cede8","resolution":{"observed_at":"2026-08-07T15:42:30.233899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-13T22:17:36.254784Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-07T15:42:30.403929Z","title":"Agentic reasoning and tool integration for llms via reinforcement learning.arXiv preprint arXiv:2505.01441, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:30.403929Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:88ebe817ffa6031fbfc158677ffa7e9ab08f03acc107856f0511900fe10865e8","observation_id":"c15a9e0d-c152-409d-b51a-d801dbb5b727","resolution":{"observed_at":"2026-08-07T15:42:30.403929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T15:42:30.574751Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning.arXiv preprint arXiv:2503.05592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:30.574751Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:c3a05be3fcafce877ff4a96da97f984b4b48f1f98fb0ad98038731f3d43943f4","observation_id":"5fe74b72-402f-4ed7-a260-a48087a6a253","resolution":{"observed_at":"2026-08-07T15:42:30.574751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-07T15:42:30.760995Z","title":"Zerosearch: Incentivize the search capability of llms without searching.arXiv preprint arXiv:2505.04588, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:30.760995Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:2e9edafa36e960ef4c1314e56cd8a4ca3d640a5801926a17cdf5326344bab9be","observation_id":"b9b41e95-0d47-481f-b6e2-c4ee79f0e13e","resolution":{"observed_at":"2026-08-07T15:42:30.760995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T15:42:31.079097Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:31.079097Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:5f27e39802555db25e9b8425e45cc4731eb8069d53c32b597b1b091dba7192bf","observation_id":"660aa28c-4602-46f5-8cd9-c0fb6858fbf3","resolution":{"observed_at":"2026-08-07T15:42:31.079097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T15:42:31.186825Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:31.186825Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:11877904ec975df85628a09fdb0bbc6e2bcec67eaff3de181686a777e4ff00b0","observation_id":"7991defb-546e-4abb-b9e3-28a9c4270a6c","resolution":{"observed_at":"2026-08-07T15:42:31.186825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T15:42:31.288162Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:31.288162Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:cb080ff987ca8cafa446be439b11a6afacc5965700952f335da602b304dfb71f","observation_id":"2ce2bc79-6281-4e92-841f-cf235de462ee","resolution":{"observed_at":"2026-08-07T15:42:31.288162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.477496Z","title":"Musique: Multihop questions via single-hop question composition.Transactions of the Association for Computational Linguistics, 10:539–554, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:31.477496Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:57873921f4ff310e5bc2e41daabfc85f42173b9e737f7cb02dfdc5b8952732af","observation_id":"a40dff6a-fe12-4059-849e-2e610f03f36c","resolution":{"observed_at":"2026-08-07T15:42:31.477496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:42:31.628464Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:31.628464Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:ba4d0c9aea8889527e09c8f1a6bbe51264d1d8302d6c239f776b2a7cfaff71d4","observation_id":"9c1c7d64-fd79-40a6-a2bd-b1b8d8d2bf3f","resolution":{"observed_at":"2026-08-07T15:42:31.628464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-11T10:35:06.989614Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T15:42:31.866291Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering.arXiv preprint arXiv:1809.09600, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:31.866291Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:d48d222ce479aacd454dcecf53d6b0f21f32914eec70819a891c67a8d270b606","observation_id":"4fa59e86-7134-406c-a9d6-16d7f0b619b9","resolution":{"observed_at":"2026-08-07T15:42:31.866291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.740404Z","title":"Detecting texts of arbitrary orientations in natural images","venue":null,"work_id":"8b466147-c80b-43ac-9cb3-e6d472a4e219","year":2012},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.062592Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:94f8d41d41ec129bf226716604b4c143f40e68010b3f0d62333d2f998f5d56dc","observation_id":"8599fc09-f5f1-400f-9b79-f8c25aa03f61","resolution":{"observed_at":"2026-08-07T15:42:34.815225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.521338Z","title":"RlHF-V: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"314744ab-d1c9-45af-9b90-6412ac8be580","year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.246782Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:d947de7449c3aab8622a8ab6779448d96a928d2bb62ff63457111d3765ddd59f","observation_id":"6c40227d-ec06-4d68-8082-0a6ea4305e67","resolution":{"observed_at":"2026-08-07T15:42:34.659736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.400015Z","title":"RLAIF-V: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.arXiv preprint arXiv:2405.17220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.400015Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:18741bb6e4bd19e1050febed13440b490f36236c7c61f402ca1e4e9a507fa7b4","observation_id":"2e6cd8f5-b10e-4e77-ab84-ae3dcf275d60","resolution":{"observed_at":"2026-08-07T15:42:32.400015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T15:42:32.512442Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.512442Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:116745c1b4d506b923ada3621ace222c77a44f67d70252b9e57f77e66998f64a","observation_id":"af863026-8903-46e6-adf7-f264d3c4b139","resolution":{"observed_at":"2026-08-07T15:42:32.512442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T15:42:32.658392Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output.arXiv preprint arXiv:2407.03320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.658392Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:b4a40a65646fd587be75a94b96e0e2a6540e2c66484c55ae53c9ad090a14c818","observation_id":"bce2c218-ac62-4c3b-9be2-da4876f22f2b","resolution":{"observed_at":"2026-08-07T15:42:32.658392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-16T17:32:15.587088Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T15:42:32.736707Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.736707Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:4d7114de43bb4a3399500f9c0b40d7649fdf4712d8b3b2b0e16ea1d32ad99b17","observation_id":"f62d10de-d64c-42de-b2d7-77681a765934","resolution":{"observed_at":"2026-08-07T15:42:32.736707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T15:42:32.811587Z","title":"Aligning modalities in vision large language models via preference fine-tuning.arXiv preprint arXiv:2402.11411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.811587Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:7e3677c1850d520a22a9eb18b778e449f9648f55d3c15f973f4a3a4584f706dd","observation_id":"e1735659-6f1a-490c-ad60-14d9df918b7a","resolution":{"observed_at":"2026-08-07T15:42:32.811587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.331164Z","title":null,"venue":null,"work_id":"4c7d587d-c6d8-4c84-ba48-c966473839f6","year":null},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.887357Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:a2c4f65fc8a8e107eee36fbe4d1bdc71086658d35c41ae09817e8f80a3841f7a","observation_id":"7201fc3b-4375-46ef-8839-c0f51fdc0c73","resolution":{"observed_at":"2026-08-07T15:42:34.441995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.167702Z","title":"the image","venue":null,"work_id":"0e5804cc-2dc2-4aa2-a72f-c889419b4ea9","year":null},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.983752Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:7123dd8ffc043731618f3badff54e97e9e78ae1609c023630510af356cf1796f","observation_id":"782efb4f-3f10-48d7-af85-c042c9b8637b","resolution":{"observed_at":"2026-08-07T15:42:34.253285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.001378Z","title":null,"venue":null,"work_id":"62fda16f-6322-464d-ac84-4236f97bb7b5","year":null},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:33.046243Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:93eb85a8e77d41fab7220bf84d2fd7cc722afefc757af145ac24e3d2cdb443bb","observation_id":"94189a73-5fb7-42d9-b570-b5eb87aa8083","resolution":{"observed_at":"2026-08-07T15:42:34.082769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.812935Z","title":null,"venue":null,"work_id":"0ee23615-a386-4e84-995e-d502b44c4722","year":null},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:33.132888Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:fb6182fc3a8e4ee0f276168e08261ce51a446f1b03c451cdd150954c7013b275","observation_id":"7ebc7938-f7eb-42c3-86aa-fb1ab16214ef","resolution":{"observed_at":"2026-08-07T15:42:33.892630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.665545Z","title":"Can You Find Vermeer's Milkmaid at the Rijksmusem?","venue":null,"work_id":"bffdfeee-9544-4f98-bcb9-14c453ce4025","year":1994},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:33.223922Z"},"links":{"citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:b9801ad918070b059cffb5b300c16e90be14356eeeb400d8a0fa75e8315dcc11","observation_id":"b4ca1758-b303-4889-ac1a-bcfa784645eb","resolution":{"observed_at":"2026-08-07T15:42:33.740334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 26 inbound Pith citation observations for arXiv:2505.14246."}