{"as_of":"2026-08-10T15:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:286cf9cc5483dce9c4b0e210207f3f3bd49f33412a81978a3ef08428868aec13","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:40.120459Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:30:03.053598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.147388Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:428e7baeaff0e082b4b09cd4440f4e1a5e113f4e101b60b3984f5f7d4902d256","observation_id":"aa875bb9-c0b3-41b7-8c59-6dbbba4db11f","resolution":{"observed_at":"2026-05-18T19:21:48.261893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:785386964ce8b2821173d3cf5c4cefc8ce6f6cc5cf312b4ec0a6ebd604f021eb","observation_id":"cb67b269-a8a5-41a4-974f-2f01fb059d25","resolution":{"observed_at":"2026-05-15T18:41:30.400550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-02T22:10:49.569781Z","title":"arXiv preprint arXiv:2505.20289 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17665","last_updated":"2026-07-12T17:48:41Z","snapshot_observed_at":"2026-08-09T06:01:13.885489Z","submitted_at":"2026-02-19T18:59:54Z","title":"OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:10:49.569781Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2602.17665"},"observation_digest":"sha256:250bcaf3e8b387ab8c78e4efc73be11ab55dcc87ce93bf0d27f0c8dc91d6638e","observation_id":"9b5f1228-cac0-48fb-9481-8f569a5422a9","resolution":{"observed_at":"2026-08-02T22:10:49.569781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T07:14:48.918959Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:934c0404851f6c019a9608c7f6323b3f69c6882193b805f866ad1d4b462ecbc7","observation_id":"36ae82ce-49a7-4938-abca-ade047ceada9","resolution":{"observed_at":"2026-05-13T07:17:29.187051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:47:50.595481Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:b176d40f7d9c38c507df521a1ea915096ce28e442023c737b9f4de961a7b64e2","observation_id":"e149e1ea-637f-4b6b-b131-7f05cef92eae","resolution":{"observed_at":"2026-05-14T21:48:00.623176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2605.26861","last_updated":"2026-05-26T11:20:09Z","snapshot_observed_at":"2026-08-02T14:18:12.692996Z","submitted_at":"2026-05-26T11:20:09Z","title":"REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T18:19:10.346738Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2605.26861"},"observation_digest":"sha256:98eb4fafca7d6a51c550a7041f2f0765c02a2e7b7d813e51540241c989dc2fe0","observation_id":"11fce3b3-03fa-4695-a0bb-17051f699a0a","resolution":{"observed_at":"2026-06-29T18:23:50.702685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:29f7f2a1731cf4cd0e0f02b061360a4816d071b02862adeedb675d6e8e64b995","observation_id":"de041ff8-84d2-441e-9567-5a8772b38d6c","resolution":{"observed_at":"2026-06-28T20:22:37.695015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":"2505.20289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-07-04T15:09:55.147388Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection","venue":null,"work_id":"2cac6acc-17bd-44a5-8ab3-c3a9c375509a","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:4d3ff4d000fccee47b9756c2702e4f5e4bd786952d62d7a1d724138355641a58","observation_id":"f01cae5e-0002-47e1-b14a-147576225dbe","resolution":{"observed_at":"2026-07-04T15:09:55.149238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-01T00:59:21.527737Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection.arXiv preprint arXiv:2505.20289, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-01T00:59:15.902226Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.527737Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:b166e5c5f2601268c927c69629242f93a2e896e77bd9e5337d319247b78a9587","observation_id":"12c40016-1136-4111-a9a1-a24b220f201d","resolution":{"observed_at":"2026-08-01T00:59:21.527737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-08T00:30:03.053598Z","title":"arXiv preprint arXiv:2505.20289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.053598Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:52900a560eebb0c1f1c356fa76e32ce8e7b876c2c55a04c975fc75c9b32b5ee6","observation_id":"2ecdc0a2-7efb-4598-a93b-4def83e45495","resolution":{"observed_at":"2026-08-08T00:30:03.053598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20289/citation-record","integrity":"/paper/2505.20289/integrity","json":"/paper/2505.20289/citation-record.json","paper":"/paper/2505.20289"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:59:35.679510Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.679510Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:08c18e0b57f6924bf6a97077b6a89ebdcae46e99fadd19a205f680b70d2d0ddc","observation_id":"bdd3af60-36f6-4ff6-9905-7332016ec311","resolution":{"observed_at":"2026-08-07T13:59:35.679510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.982650Z","title":"Language models are few-shot learners","venue":null,"work_id":"2189e381-09c9-4e2d-bd4a-9839ec1c86d7","year":1901},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.772704Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:9651817bfbd5c3b381676931fe7a0a93ff01290fe922f536e96fc525ceb8c5f4","observation_id":"d08f3d56-2dfc-49e1-80c0-075079462928","resolution":{"observed_at":"2026-08-07T13:59:43.052275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:59:35.839303Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.839303Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:c57ef0fc92d0b6f25ec45eb7772b85d4dc95b940412fb3f1f037a7e18cb29166","observation_id":"ab323fc2-493c-4d18-b486-9882846af7be","resolution":{"observed_at":"2026-08-07T13:59:35.839303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:59:35.888788Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.888788Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:4a7da1fb6c04fbcf8edb39bb8401094ae31f98040b00acd6c255174de5763592","observation_id":"cdba0ffa-9c85-4a20-a6ba-90a550228e0e","resolution":{"observed_at":"2026-08-07T13:59:35.888788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:35.927742Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.927742Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:d77322d56801f089f53b00ef049fb8b8c9179be4593fc90babb1e145a59bc5ee","observation_id":"688941ca-0a04-47d9-b69b-2e2700a5f615","resolution":{"observed_at":"2026-08-07T13:59:35.927742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:59:36.008311Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.008311Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:79f353b9698e45fa2c1686356a83dad9997da818bb9674264852795c2c2c93a1","observation_id":"afde5757-ba96-4b33-b939-a1c33aab25b7","resolution":{"observed_at":"2026-08-07T13:59:36.008311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:59:36.102797Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.102797Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:89bb16f58623afe096ad24ed1fe3323ca5109a5a16b09a0763fd775c57375dfa","observation_id":"e01f5360-5b6f-4a5b-b824-68d7ebcb87cc","resolution":{"observed_at":"2026-08-07T13:59:36.102797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-07T13:59:36.173060Z","title":"Program of thoughts prompt- ing: Disentangling computation from reasoning for numerical reasoning tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.173060Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:4f468c37ea0720ad9c7ea461e78bd3fb437a3a298a2996d86759a0ff797d8310","observation_id":"3f8024ca-e64d-44f5-8ce5-d7d481dfac4d","resolution":{"observed_at":"2026-08-07T13:59:36.173060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-07T13:59:36.266705Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.266705Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:61299c3d2937448eb653c071484b1bd00f89fd08a5aae36b3877fc9cc5d4ee77","observation_id":"8de9d6e9-170e-4728-98a1-1e4079043ccc","resolution":{"observed_at":"2026-08-07T13:59:36.266705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.332759Z","title":"Pal: Program-aided language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.332759Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:433e00bec04f72f041d0dbd33a09bed8c4f34c694dc09cc01edbe92d0eed77c9","observation_id":"a73f13ec-d452-470f-9684-e0d8ba91a76f","resolution":{"observed_at":"2026-08-07T13:59:36.332759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.714700Z","title":"Gorilla: Large language model connected with massive apis","venue":null,"work_id":"9c4160e8-4320-4364-b1a5-a78ecec793dd","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.414302Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:c80f7067194154d42b2af76e9a4f1e8fb8623eb4e66c47254d8bf147fdbd9c9b","observation_id":"5e26eaad-20dc-4f94-a5a8-e12345f4ce40","resolution":{"observed_at":"2026-08-07T13:59:42.818668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T13:59:36.478765Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.478765Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:d09b60702ec4cb670f4c92a91c1355ac826360e46e48c1bd63d50c9ea1d702f8","observation_id":"2fa008a5-8011-47d7-abef-8f08ead072a1","resolution":{"observed_at":"2026-08-07T13:59:36.478765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.556198Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.556198Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:23e5293b973b0e6da87d754f8ae279b5683a61b18866aa8a6fb91ee5b6b4fa80","observation_id":"8875f002-9e09-4fbc-8494-38984220fb19","resolution":{"observed_at":"2026-08-07T13:59:36.556198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.544117Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"4545e099-3b0f-4b80-a4c3-e54cac1a07b7","year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.625081Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:7cdaff5e1ede726caf6215297c177eebe53e087618979b5ff30473a4d7c18f90","observation_id":"9de7870e-40fa-46a8-8b5c-b1aa33c00c86","resolution":{"observed_at":"2026-08-07T13:59:42.614098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.401203Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"39103580-b802-49bc-ad9d-b8e00b60bcc9","year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.697970Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:5b4395211b5b8bbe33006660cbcfa157bb6ea746539612e92986f56b72d848db","observation_id":"bff801ff-b139-4cb6-929f-eeb09cfb4686","resolution":{"observed_at":"2026-08-07T13:59:42.461624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.748773Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.748773Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:4cb328b89ebcfcc4243c427cc7aa8a54e2da1856da1c9ceba89ccbd64527a824","observation_id":"6da95cc0-cc6c-4f67-96b8-8da502b1191f","resolution":{"observed_at":"2026-08-07T13:59:36.748773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11271","last_updated":"2026-04-13T23:08:01Z","snapshot_observed_at":"2026-08-03T02:43:16.180683Z","submitted_at":"2025-02-16T21:18:47Z","title":"OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11271","snapshot_observed_at":"2026-08-07T13:59:36.843545Z","title":"Octotools: An agentic framework with extensible tools for complex reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.843545Z"},"links":{"cited_paper":"/paper/2502.11271","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:629104b7b0e02ac02cd4400e684ba358b3640a1bd5edd5de95a9b42447218f85","observation_id":"98792aca-f97f-4bc4-baaa-cb14ae54f20e","resolution":{"observed_at":"2026-08-07T13:59:36.843545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:36.900888Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.900888Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:79834db398b4ac1de8448a32346c718a853a95f02696bae460442affb2466a82","observation_id":"4dd80ee7-9102-4d5c-b7ef-a280e31fca07","resolution":{"observed_at":"2026-08-07T13:59:36.900888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T13:59:36.982009Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.982009Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:12a61ce54332f498b3a0919befdb35b3d93c59423e7efe79d9b175679ed34be7","observation_id":"72fc4b0c-cf1c-40de-a9e1-66826631bbe0","resolution":{"observed_at":"2026-08-07T13:59:36.982009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-07T13:59:37.062514Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.062514Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:f678ef9e0bc09e284a500efe1f3d2659a8d4193cb7c0fdbca62133d26688992a","observation_id":"14f40af1-03f3-4515-ba06-7b0a00e206f9","resolution":{"observed_at":"2026-08-07T13:59:37.062514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07566","last_updated":"2021-07-15T19:00:35Z","snapshot_observed_at":"2026-07-06T11:29:34.579530Z","submitted_at":"2021-07-15T19:00:35Z","title":"Internet-Augmented Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07566","snapshot_observed_at":"2026-08-07T13:59:37.132107Z","title":"Internet-augmented dialogue generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.132107Z"},"links":{"cited_paper":"/paper/2107.07566","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:bc682848c57ae9bfdf3921584020a10560cf5d076f783cb51222498353d0bcad","observation_id":"28f6d4d3-57c7-46a2-bf52-6987a05e02fe","resolution":{"observed_at":"2026-08-07T13:59:37.132107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:59:37.207212Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.207212Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:ae48e1016247c0472922a28b32e9d58bbdd460c2990c0a698745a0d4fa8845cc","observation_id":"4aefe993-3f2b-4298-84de-a1e815114d44","resolution":{"observed_at":"2026-08-07T13:59:37.207212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:42.208967Z","title":"Learning to reason with llms","venue":null,"work_id":"a034a293-76ea-4819-8553-4dbc4dc55463","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.248131Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:5752efb57f6852e0ec38777b6fa8a28fb868373f356cf852114837a1274b764b","observation_id":"410dfcc5-d158-4ba6-8771-3b41ddc00ba4","resolution":{"observed_at":"2026-08-07T13:59:42.275098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:59:37.341748Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.341748Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:cec051070fbc9a9a5fac4a4c013f3df9addf058d26fa26d9aac498061c0eeb4b","observation_id":"ff8373f4-ace7-4f6b-a2cf-ffe6e4e5a260","resolution":{"observed_at":"2026-08-07T13:59:37.341748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:37.420694Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.420694Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:ced68bc3b4790ad60ebcda13b996eb05848473ad8ead0fc2b351bf4357202ecd","observation_id":"100c0509-79ce-4388-bf35-80bd2e7076ea","resolution":{"observed_at":"2026-08-07T13:59:37.420694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T13:59:37.501506Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.501506Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:62d9d5b1ca5faa1b1f282bfd0f9228b94b8eb38a640d710823356eba063d4104","observation_id":"4c15750b-4aaf-4190-9fda-8f7d5351c0ba","resolution":{"observed_at":"2026-08-07T13:59:37.501506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T13:59:37.624601Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.624601Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:04e0e5efe74ff01d64260b0d5be56e556e00a079e98c555764e10736d42e114f","observation_id":"d494e456-33be-4295-947b-67488fb35dc9","resolution":{"observed_at":"2026-08-07T13:59:37.624601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-07T13:59:37.694952Z","title":"Retool: Reinforcement learning for strategic tool use in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.694952Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:e12d4f13eec876232c4a973414fc3627a84df9a0e721cb9e64daab1978c135e7","observation_id":"7414b3f1-a4ed-4a47-96b6-565e97e5c9cb","resolution":{"observed_at":"2026-08-07T13:59:37.694952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:37.771338Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.771338Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:28b64437df810863c6f9034770e1ffa73950c04449261d784d318285ec28011a","observation_id":"301746a9-4f66-44b0-b061-cd7eb6fe2622","resolution":{"observed_at":"2026-08-07T13:59:37.771338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T13:59:37.840955Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.840955Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:30ac4f195a709f231dbe928620066501c93891af025d9a98c9a463051205456c","observation_id":"c5905332-3d3c-4336-9b61-542c0e738dad","resolution":{"observed_at":"2026-08-07T13:59:37.840955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:37.936932Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:37.936932Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:5b911f08072c4296bed102af700beeaf9163343fd3a5a6e60a4def45d996156f","observation_id":"79c0902b-3de5-453b-b578-d6bd921dc99a","resolution":{"observed_at":"2026-08-07T13:59:37.936932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:59:38.012150Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.012150Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:9ef51a27f83c42e4e77f8b86549aed0bfa26d3e769bcc03e6f677ae6290f209f","observation_id":"ed414bfd-688b-4641-afb4-c2a87b98951c","resolution":{"observed_at":"2026-08-07T13:59:38.012150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-03T20:34:57.164411Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-07T13:59:38.116421Z","title":"Unichart: A universal vision-language pretrained model for chart comprehension and reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.116421Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:82cc9c3d9f5205376b98e711fdd6ad42a8a95960509dfe2924af960fd4754761","observation_id":"13414287-fbf4-4ebc-be64-4472e5db32cc","resolution":{"observed_at":"2026-08-07T13:59:38.116421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10505","last_updated":"2023-05-23T18:28:39Z","snapshot_observed_at":"2026-08-08T00:11:52.450834Z","submitted_at":"2022-12-20T18:20:50Z","title":"DePlot: One-shot visual language reasoning by plot-to-table translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10505","snapshot_observed_at":"2026-08-07T13:59:38.207103Z","title":"Deplot: One-shot visual language reasoning by plot-to-table translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.207103Z"},"links":{"cited_paper":"/paper/2212.10505","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:6135eef8399dd663c67737284ba0381b660ba9265dcdec312bbf0a07a9f464b2","observation_id":"ad3c211d-e2e9-42da-81f4-cc249b8695fe","resolution":{"observed_at":"2026-08-07T13:59:38.207103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03277","last_updated":"2025-03-14T03:19:00Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:41:02Z","title":"ChartMoE: Mixture of Diversely Aligned Expert Connector for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03277","snapshot_observed_at":"2026-08-07T13:59:38.348879Z","title":"Chartmoe: Mixture of expert connector for advanced chart understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.348879Z"},"links":{"cited_paper":"/paper/2409.03277","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:ece56b4ebff0eb0d1bce3f5ff84846cd986d93854311ba7339031db985f89d54","observation_id":"82d21851-fc21-4c4b-a93d-a59872686a91","resolution":{"observed_at":"2026-08-07T13:59:38.348879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.985264Z","title":"The opencv library","venue":null,"work_id":"e3b28845-d63f-40cf-a170-5867f79cfde7","year":2000},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.471275Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:79b686e7da2e857a20c405eadc20af2fe34cef90e28a5d6f5069cf4889d96e58","observation_id":"3e2e839f-1f4f-446f-8e05-6288e7069970","resolution":{"observed_at":"2026-08-07T13:59:42.104637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.768409Z","title":"Context-aware chart element detection","venue":null,"work_id":"a3463b72-c86e-4e72-8ddf-0d3c8c0d8b41","year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.589707Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:45aedaf9933bfdf3c91ccde9a0c4e3088be79d4b9e3079801f87d3a22ad835df","observation_id":"09391139-cc9f-4177-b139-9a2919c9105d","resolution":{"observed_at":"2026-08-07T13:59:41.869761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.592257Z","title":"Chartocr: Data extraction from charts images via a deep hybrid framework","venue":null,"work_id":"bab591bd-afae-4629-8197-0145c4258846","year":1917},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.709688Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:6e886451a9b01517d5e3e50a7c7e960cd4571c397e748dff1a3560f2bd9d5f7c","observation_id":"9a651a89-6b09-4ff8-b9b2-645b107eff7b","resolution":{"observed_at":"2026-08-07T13:59:41.686448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02384","last_updated":"2024-02-15T15:34:51Z","snapshot_observed_at":"2026-08-05T02:56:29.376755Z","submitted_at":"2024-01-04T17:51:48Z","title":"ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02384","snapshot_observed_at":"2026-08-07T13:59:38.807547Z","title":"Chartassisstant: A universal chart multimodal language model via chart-to-table pre-training and multitask instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.807547Z"},"links":{"cited_paper":"/paper/2401.02384","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:e629837a79756cc4d931ddcd44567f242be50c088006a9fb72f786e747badfb2","observation_id":"51f9c9fe-6506-45db-9fe9-db05c6fa83c3","resolution":{"observed_at":"2026-08-07T13:59:38.807547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12185","last_updated":"2025-04-27T11:31:23Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T14:48:23Z","title":"ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12185","snapshot_observed_at":"2026-08-07T13:59:38.929113Z","title":"Chartx & chartvlm: A versatile benchmark and foundation model for complicated chart reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:38.929113Z"},"links":{"cited_paper":"/paper/2402.12185","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:67a700ddaf8a34f25ea1024df7ce8b8c1e4ee9e9d9b79ae0fe44032752ea47e2","observation_id":"250dc581-5b92-4aa4-9bf2-6ca6872fe5f6","resolution":{"observed_at":"2026-08-07T13:59:38.929113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:59:39.039095Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.039095Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:34444aa1baadabce9b53786329eb5aa81a51a50673e1dde59b220250cf0fa6bc","observation_id":"1d2389d6-7575-4bad-bc9a-1c287df02f90","resolution":{"observed_at":"2026-08-07T13:59:39.039095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.413036Z","title":"Diagram formalization enhanced multi-modal geometry problem solver","venue":null,"work_id":"c1d07447-7d23-4ac1-80cc-449b28bcafeb","year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.114084Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:129283f51cbae4c8c80c10f407b85fe802ebcc65bf93fcc97e63fdbb0316a68a","observation_id":"a9d18b27-1551-49af-bdd2-6886ad4bac68","resolution":{"observed_at":"2026-08-07T13:59:41.489164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-02T03:18:39.824103Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-08-07T13:59:39.192083Z","title":"G-llava: Solving geometric problem with multi-modal large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.192083Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:34db56e2c0f94d888b91c22b5be8de8f0ea951c8c124d838420de47ccebbec9c","observation_id":"aa07cd9b-8274-4328-8380-29586848cb9b","resolution":{"observed_at":"2026-08-07T13:59:39.192083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-08-09T14:33:03.506246Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-08-07T13:59:39.265256Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.265256Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:dbf175feef2356d439f1ae566cfd316000fc622f18167cca0d72421e137ac84b","observation_id":"5c99f6ec-2a88-4c96-82ec-425ab61a8f4b","resolution":{"observed_at":"2026-08-07T13:59:39.265256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T13:59:39.319182Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.319182Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:728e3726de63b59e6f2a0ff8f82a0e42705e83aaf1d8898aa05676863f35a93a","observation_id":"10cac71c-70f2-4a17-9fb6-b6f207e1c2a6","resolution":{"observed_at":"2026-08-07T13:59:39.319182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:39.365404Z","title":"The claude 3 model family: Opus, sonnet, haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.365404Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:7e9608588ba39844369771054cf4d40a16e1e2f5ec735c93da3bfd4ce54168b9","observation_id":"5ed9a8b4-64cd-4945-92a2-09d1c88075be","resolution":{"observed_at":"2026-08-07T13:59:39.365404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T13:59:39.424086Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.424086Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:d4e5f6a0aa0093d7cc716a941d77b91954d3c1f13609eef2b78c457e1664489a","observation_id":"dcc3e15b-a8b2-4a86-8408-0a0b0d4808b2","resolution":{"observed_at":"2026-08-07T13:59:39.424086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T13:59:39.471308Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.471308Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:8624b9e50d1fb8266371df7e1aa042e7a56b53bfdeabde586414dd786ed07297","observation_id":"3dfde684-e0ac-4615-8c21-75abe6408fa0","resolution":{"observed_at":"2026-08-07T13:59:39.471308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.262942Z","title":"Internvl2: Better than the best—expanding performance boundaries of open- source multimodal models with the progressive scaling strategy, July 2024","venue":null,"work_id":"f96aa23e-739d-4eed-97b7-1f26bbf78c1e","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.533698Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:8214eae0babd289f806a6b177c43e0d9690121b3e2463313058a5a99fb43dd69","observation_id":"9a6983b9-d7e6-45de-9416-b3084d58b5e0","resolution":{"observed_at":"2026-08-07T13:59:41.333416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:59:39.588544Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.588544Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:88d5386634c113ddcfc2d410278b6e0478a66cfe81ba9ea8540e5f5487751008","observation_id":"1f86a0a9-77b2-42c9-9c11-5294c7f4e863","resolution":{"observed_at":"2026-08-07T13:59:39.588544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:41.060698Z","title":"Cambrian-1: A fully open, vision- centric exploration of multimodal LLMs","venue":null,"work_id":"58023d64-7834-4d62-9e4b-0427845bd3f1","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.642125Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:fa621a8e5f3a859a264e29ddb6417be1b05e34a7db87108e219b32f0dc065fff","observation_id":"6ea81de3-cb5c-44bb-b0c2-ccfb6e8f4fbf","resolution":{"observed_at":"2026-08-07T13:59:41.165486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T13:59:39.719031Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.719031Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:3ef7f069246d2c913b8ee3b6cef901c73edbbfee9b406ed485b85794f61d2b82","observation_id":"1b80ee2c-5315-4a66-8ea4-acccf288e58d","resolution":{"observed_at":"2026-08-07T13:59:39.719031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T13:59:39.764847Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.764847Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:e47dc602591a8ffe45fe69272b3ebdd2ef0b7c150f776b8d31bd79aefc11a3e1","observation_id":"f25f61f5-941e-4ba4-9855-539b3bfd3da8","resolution":{"observed_at":"2026-08-07T13:59:39.764847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-08T00:41:26.316141Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T13:59:39.820900Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.820900Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:689fd5a9e737f8eded42ec113f3153149481a7b0a24ef22235c737942c66a0df","observation_id":"3006adf5-42af-4746-b61d-4e572fd8820a","resolution":{"observed_at":"2026-08-07T13:59:39.820900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-07T13:59:39.871961Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems? arXiv preprint arXiv:2501.11284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.871961Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:523759d722bd2caf3264e549bc8ba2b3fc65e01b41d4de01b47ba83138f74cb2","observation_id":"6cec24d0-f256-4c17-9cd9-8c44588cd93e","resolution":{"observed_at":"2026-08-07T13:59:39.871961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:40.843145Z","title":"Improved baselines with visual instruction 15 tuning","venue":null,"work_id":"1821f5a8-614e-46de-a642-dcfed14107c4","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:39.941166Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:e4084316cd1e079a78be9e6bac44f8814fc9f83ba7bd3a50991d644e44fc6f2a","observation_id":"a2e7b4b2-2738-4452-a79d-b384cda0cb89","resolution":{"observed_at":"2026-08-07T13:59:40.966064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:40.006031Z","title":"xGen-MM (BLIP-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:40.006031Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:10822f24b6c5d48c925b00e27b0eb71811011c802daf93fde01d87780d8d48c1","observation_id":"e1a78340-085f-4938-a3ba-adeab8c7d730","resolution":{"observed_at":"2026-08-07T13:59:40.006031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:59:40.054356Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:40.054356Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:c39988a2c7ec0000ef58c5783c3f0064391adbb752b60e016641bc2bd1f05ecd","observation_id":"5361dfab-5fa2-4314-a908-cde932edbe19","resolution":{"observed_at":"2026-08-07T13:59:40.054356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:40.627965Z","title":"Vision language models are blind","venue":null,"work_id":"20d5fccf-0113-4c4e-b6ca-59996642051f","year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:40.120459Z"},"links":{"citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:98360b2e8aa783b5a89d44f89934659db91b491cc3109f6db0a5c47d8b0510fc","observation_id":"248a11fb-53c1-4729-a873-46e668f615f3","resolution":{"observed_at":"2026-08-07T13:59:40.721505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 10 inbound Pith citation observations for arXiv:2505.20289."}