{"as_of":"2026-08-13T04:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc8454f618474ff2c8b337fb4d84c5a98d572598ede238d711249d2614d20a23","coverage":[{"denominator":129,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:53:14.503030Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09682/citation-record","integrity":"/paper/2608.09682/integrity","json":"/paper/2608.09682/citation-record.json","paper":"/paper/2608.09682"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.922601Z","title":"Latent reasoning with supervised thinking states.arXiv preprint arXiv:2602.08332, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.922601Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:06b74e2933f4fd4c90fe2d1dd3e604699a03dedf4c158d6ded57e78b7b51b892","observation_id":"21d126e9-bc08-49be-ac7a-28c7872f3451","resolution":{"observed_at":"2026-08-11T12:53:13.922601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.930040Z","title":"Acloserlookatbiasandchain-of-thought faithfulness of large (vision) language models.arXiv preprint arXiv:2505.23945, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.930040Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:5cf5becba484fca300cb432b45cd3c2b842807ffa3990c36b20c37c3da50c763","observation_id":"3b40b537-9d4c-4dae-87c7-72e0cbaead1d","resolution":{"observed_at":"2026-08-11T12:53:13.930040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-13T00:57:35.982934Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T12:53:13.935715Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models.arXiv preprint arXiv:2403.06764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.935715Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:51f3c30366cd1c70b0e542224e395b36e692a62da9eabe0bdef902339bb3439c","observation_id":"54c530f6-4381-45b3-8282-d55da1520d61","resolution":{"observed_at":"2026-08-11T12:53:13.935715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.941754Z","title":"MMStar: An evaluator-centric benchmark for multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.941754Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f868fc84978f9e1911a610c3854f8035130e336d19a6f3bc5327a35891d2255d","observation_id":"4127ec8f-cb29-49ef-bf11-6a0e20ae4c03","resolution":{"observed_at":"2026-08-11T12:53:13.941754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.947142Z","title":"Perception before reasoning: Two-stage reinforcement learning for visual reasoning.arXiv preprint arXiv:2509.13031, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.947142Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:2edcc486605b36d0a4650ce22fcdc27fe689e64ac2a62762e0bbd15c1515d52b","observation_id":"e3a06ba7-1a84-4d28-9062-55bd6db2c470","resolution":{"observed_at":"2026-08-11T12:53:13.947142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-11T01:19:00.494448Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-11T12:53:13.952698Z","title":"Bowman, Jan Leike, Jared Kaplan, and Ethan Perez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.952698Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:a014cd63afbf3d259a1d4fadd7127154e619340d8b9999a8b3eea18d5e802c8b","observation_id":"c1d6048d-a793-41d2-8a99-295b545a062e","resolution":{"observed_at":"2026-08-11T12:53:13.952698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18842","last_updated":"2026-08-05T03:43:15Z","snapshot_observed_at":"2026-08-11T04:36:14.038696Z","submitted_at":"2025-05-24T19:30:47Z","title":"v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18842","snapshot_observed_at":"2026-08-11T12:53:13.959442Z","title":"v1: Learning to point visual tokens for multimodal grounded reasoning.arXiv preprint arXiv:2505.18842, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.959442Z"},"links":{"cited_paper":"/paper/2505.18842","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:dd4dbce388e046495c4fcbc9494c6d0ff7056cc088dc53c08e337bfe23d46a16","observation_id":"527f98d2-c979-4acc-b913-fbf7eec197af","resolution":{"observed_at":"2026-08-11T12:53:13.959442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T12:53:13.964796Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.964796Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:34b74ab405b06e7b84deb64ce0ca057eb11e22a2d100356ea76f25f9487be20f","observation_id":"4b2e1502-e09d-4db2-af0d-9f9e3250c7e9","resolution":{"observed_at":"2026-08-11T12:53:13.964796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-11T12:53:13.970205Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.970205Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:835f49fb7a5b117fa9dbbd0f4a2ae0b543ffbcf408ac1a73f4bd15acad75aab7","observation_id":"509a382a-9523-41ba-98f9-4c79aa25a0ef","resolution":{"observed_at":"2026-08-11T12:53:13.970205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-12T03:33:59.313788Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-11T12:53:13.978385Z","title":"Virgo: A preliminary exploration on reproducing o1-like MLLM","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.978385Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:a356ba9cf4c674ad2872d8ce784dc3e2070b90d873f29e42f92312dc475acd9b","observation_id":"93107529-ff1e-4d89-8ff6-a0d9f5579f93","resolution":{"observed_at":"2026-08-11T12:53:13.978385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.984603Z","title":"Revisiting the necessity of lengthy chain-of-thought in vision-centric reasoning.arXiv preprint arXiv:2511.22586, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.984603Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:fa6405a845ec17c456a4a906bd78ce300ceb02793a4d4655fe15d211cca2a71f","observation_id":"65d3ed44-1f15-4843-b40c-8316c5ac469c","resolution":{"observed_at":"2026-08-11T12:53:13.984603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:13.990131Z","title":"VLMEvalKit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.990131Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:3666b5fe166c16beebb186a5c85d47c79ec8ca887e09795d36e4b6b8acb3b741","observation_id":"be44b9db-1f68-4022-8868-c22a5ce9043b","resolution":{"observed_at":"2026-08-11T12:53:13.990131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-08-12T14:09:31.044610Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15879","snapshot_observed_at":"2026-08-11T12:53:13.996266Z","title":"GRIT: Teaching MLLMs to think with images.arXiv preprint arXiv:2505.15879, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.996266Z"},"links":{"cited_paper":"/paper/2505.15879","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:14c45690835f2ace5c19743067ebe970a2b2cd6358f189deebfd112f84eb6075","observation_id":"7931aa8e-29c5-4a9f-9949-92b81a812407","resolution":{"observed_at":"2026-08-11T12:53:13.996266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T10:58:22.856573Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-11T12:53:14.002043Z","title":"Reward shaping to mitigate reward hacking in RLHF.arXiv preprint arXiv:2502.18770, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.002043Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:4a4540cd7f7ac8dbc7a12cf04501c27e73edce9a54b86613da40c69e8d70cdf6","observation_id":"9056dd3f-3141-49d4-8937-2bf9ac597373","resolution":{"observed_at":"2026-08-11T12:53:14.002043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-12T17:12:13.930928Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T12:53:14.008737Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.008737Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:318c5a6b14c37a7b245f6e7602cffd6f940a80b816798b38a2868878ec2475fe","observation_id":"195d31a5-11c3-492e-af18-b14ebf648ec6","resolution":{"observed_at":"2026-08-11T12:53:14.008737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.016201Z","title":"Thinking with deltas: Incen- tivizingreinforcementlearningviadifferentialvisualreasoningpolicy.arXivpreprintarXiv:2601.06801, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.016201Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:43bd78843e50cef9d69b08bd8a592bfd819750509dc3d848f7046b8e94e08845","observation_id":"64d7c8d5-a9f5-446f-ab58-b427e8915449","resolution":{"observed_at":"2026-08-11T12:53:14.016201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T12:53:14.021564Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.021564Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:585791557ec1cb58130308986c612043c2f9003c8989f2346b849de63504bf9d","observation_id":"068e1c91-7dab-46d4-be3a-3a5502407ccd","resolution":{"observed_at":"2026-08-11T12:53:14.021564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26752","last_updated":"2026-05-12T15:07:13Z","snapshot_observed_at":"2026-08-12T23:40:41.908226Z","submitted_at":"2026-04-29T14:49:37Z","title":"GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26752","snapshot_observed_at":"2026-08-11T12:53:14.026958Z","title":"GLM-5V-Turbo: Toward a native foundation model for multimodal agents.arXiv preprint arXiv:2604.26752, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.026958Z"},"links":{"cited_paper":"/paper/2604.26752","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:91b244f30119f32b1b99ae981641f96da30893bee05eaf4de96694cf9ddf61ca","observation_id":"a332fe5b-83bd-4f84-a92e-1559c14595f7","resolution":{"observed_at":"2026-08-11T12:53:14.026958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.032344Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.032344Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:15e436794734acdb9d9739258a9023634c93c9e88cf18ab004eb377d9df0b6d3","observation_id":"0456dc97-cbd6-472e-9331-b839f796af49","resolution":{"observed_at":"2026-08-11T12:53:14.032344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-11T12:53:14.037446Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.037446Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1f856a0e845c6a30c498627e7377b33a354097ca0d41804cdc5ae2a9d931f314","observation_id":"e15c4967-d4e1-4555-9a7d-b39829d8404d","resolution":{"observed_at":"2026-08-11T12:53:14.037446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-11T12:53:14.046256Z","title":"DeepEyesV2: Toward agentic multimodal model.arXiv preprint arXiv:2511.05271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.046256Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:06638dbd6eb8fe440d1db368ba3230ddc4924b471da4355e1978d45782b44cee","observation_id":"661bcc98-115d-42d1-af70-47b2e98f38f0","resolution":{"observed_at":"2026-08-11T12:53:14.046256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.052496Z","title":"Hollon, and Bryan Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.052496Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:91cfd27ac76550430f331172b260f0519f0a68be32613188271e781982bf5bd1","observation_id":"caeb8699-53c6-4525-ae64-b3f61ae401e4","resolution":{"observed_at":"2026-08-11T12:53:14.052496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-13T00:45:29.822527Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-11T12:53:14.059008Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.arXiv preprint arXiv:2406.09403, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.059008Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:3438caa73128ca5e5da7b58dc1a17d1783b71490f8b508b9c3f6bbaf5aad4d6b","observation_id":"24edadf1-b96c-40e0-b450-1d1055e80bc6","resolution":{"observed_at":"2026-08-11T12:53:14.059008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.065378Z","title":"VerlTool: Towards holistic agentic reinforcement learning with tool use.arXiv preprint arXiv:2509.01055, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.065378Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1aae6681068e8fe5d00d0322ea92cf962c1f84293a8b7b7ac607ec4b0a201e1d","observation_id":"2688c6b2-61ba-4f3a-b127-b6d76bfd8826","resolution":{"observed_at":"2026-08-11T12:53:14.065378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-11T12:53:14.072026Z","title":"Kimi K2.5: Visual agentic intelligence.arXiv preprint arXiv:2602.02276, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.072026Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:d5cbb44523bb6d619f7e420299643328db885f522be1aff7a5317bb4841973f9","observation_id":"59f00b1d-851b-48ac-9c49-cf03c313ff85","resolution":{"observed_at":"2026-08-11T12:53:14.072026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-11T12:53:14.077712Z","title":"Mini-o3: Scaling reasoning patterns and interaction turns for visual reasoning.arXiv preprint arXiv:2509.07969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.077712Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e9c577bb9c9c3dd662add7ba8a67afb0692bff11709f0c30ac99cac86340228e","observation_id":"b105647b-87f3-4fb7-82bf-6f0446626b1f","resolution":{"observed_at":"2026-08-11T12:53:14.077712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-11T12:53:14.083137Z","title":"Bowman, and Ethan Perez","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.083137Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:451250df75524eaf42905036d0f90c535159a01f94a8776c9d737bde14813d2d","observation_id":"2897de1e-e8b0-45dd-9850-acec5ccdf6bc","resolution":{"observed_at":"2026-08-11T12:53:14.083137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.088153Z","title":"Zebra-cot: A dataset for interleaved vision language reasoning.arXiv preprint arXiv:2507.16746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.088153Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:18e76f236c426d4e8dd41b31504209368ec320cf42d6f5c2a9cf407109c4aa2d","observation_id":"35cf9fd5-68e4-40d2-972e-a5679640d9ca","resolution":{"observed_at":"2026-08-11T12:53:14.088153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.092965Z","title":"Tir-bench: A comprehensive benchmark for agentic thinking-with-images reasoning.arXiv preprint arXiv:2511.01833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.092965Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f81a49d15e5817bf99230999436a10e79b69dee0f88ed1941a848d6d5bbc03bf","observation_id":"76d54afa-1dd1-45c7-bd61-5613d7a3532b","resolution":{"observed_at":"2026-08-11T12:53:14.092965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-11T12:53:14.097596Z","title":"Seg-zero: Reasoning-chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.097596Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:b0d29cef3178d138ee83534e7cdfcb8188af534ce2cbde2752748b8fb48e87a8","observation_id":"6155944d-2c98-4ebf-ac10-b83d52418bbb","resolution":{"observed_at":"2026-08-11T12:53:14.097596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.102763Z","title":"On the faithfulness of visual thinking: Measurement and enhancement.arXiv preprint arXiv:2510.23482, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.102763Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c6e42aacf05d67701e953271a466d4c33d4af365d178007857f3fe86e2467368","observation_id":"8c4c7087-0bf3-4c1c-ba1f-f214947de793","resolution":{"observed_at":"2026-08-11T12:53:14.102763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-08-13T00:50:05.558651Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-11T12:53:14.107674Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.107674Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:885a46d32d5c311e7104b4ea9b77e1c697e6788a5eb470b2e0bb2a07af46312b","observation_id":"fed3ace4-7f7a-4068-a766-df90f1678d4d","resolution":{"observed_at":"2026-08-11T12:53:14.107674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.113186Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.113186Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:aeb557319d059e34a7dc2714601f567410f631b542c0af5fd60af61ea60920b1","observation_id":"62e485d8-49de-4c3a-9605-ae3b6734b188","resolution":{"observed_at":"2026-08-11T12:53:14.113186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-11T12:53:14.118396Z","title":"Reasoning models can be effective without thinking.arXiv preprint arXiv:2504.09858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.118396Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f52e196c8b6dad70b03841361da6cd24511837eb08c1d7c5a69e5599cb524f2f","observation_id":"9004a401-c7d2-49cc-ba01-b07b1b464f24","resolution":{"observed_at":"2026-08-11T12:53:14.118396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01334","last_updated":"2026-05-21T13:03:08Z","snapshot_observed_at":"2026-08-10T10:27:06.939498Z","submitted_at":"2026-02-01T17:00:50Z","title":"What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01334","snapshot_observed_at":"2026-08-11T12:53:14.125300Z","title":"What does vision tool-use reinforcement learning really learn? disentangling tool-induced and intrinsic effects for crop-and- zoom.arXiv preprint arXiv:2602.01334, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.125300Z"},"links":{"cited_paper":"/paper/2602.01334","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:252cf21d6640e78beadce4b2a6c62610895823e0e4efb6252af1251da5e42d84","observation_id":"87e7c981-a900-4a4f-9443-7f23e41f7676","resolution":{"observed_at":"2026-08-11T12:53:14.125300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T12:53:14.131378Z","title":"ChartQA:Abenchmarkfor question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.131378Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:74706e5d02c52c3f4ed60feba64dac6f746259844519ac8d3655adb16d137fbd","observation_id":"8c9b6ca7-8c46-4542-b286-5c2210ec5976","resolution":{"observed_at":"2026-08-11T12:53:14.131378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-11T12:53:14.137144Z","title":"GSM-Symbolic: Understanding the limitations of mathematical reasoning in large language models.arXiv preprint arXiv:2410.05229, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.137144Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:34051d26e097e929b133df3c2572d03a3c9b38fbf38ec923067256b2069703a6","observation_id":"d915d33d-2552-490f-b362-54b7e010fd32","resolution":{"observed_at":"2026-08-11T12:53:14.137144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-11T12:53:14.143566Z","title":"Show your work: Scratchpads for intermediate computation with language models.arXiv preprint arXiv:2112.00114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.143566Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8c307edd8743466dc82905a0694d1322c5f4ab3f44b951a09137bfc5a5da16d3","observation_id":"38d5594e-04c8-45a8-9b98-56a44e4122d7","resolution":{"observed_at":"2026-08-11T12:53:14.143566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T12:53:14.149920Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.149920Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:9610ccdab1e9d6cd6d1edb7a7b192c04e6800d7c550d59618024c8e165ac17f3","observation_id":"ab05b758-cb33-47e7-92ea-c69c2c1dc7d4","resolution":{"observed_at":"2026-08-11T12:53:14.149920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.156357Z","title":"Thinking with images.https://openai.com/index/thinking-with-images/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.156357Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1d8a2835aa46990e2fdcda6608291fe7e38342f7c8bbcd7be921384e2e787ca7","observation_id":"29b9e7f1-eedf-448c-beb2-59ffb461b6e5","resolution":{"observed_at":"2026-08-11T12:53:14.156357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.161693Z","title":"Do MLLMs really see it: Reinforcing visual attention in multimodal LLMs.arXiv preprint arXiv:2602.08241, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.161693Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:198bfe5044a75950131096482a5bd52d954ec94278bec2666b5a3507e66cee98","observation_id":"7a9f1ba0-82a1-4a24-ae45-3cfb98252cde","resolution":{"observed_at":"2026-08-11T12:53:14.161693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-13T04:24:55.131656Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-11T12:53:14.169132Z","title":"Cogcom: A visual language model with chain-of-manipulations reasoning.arXiv preprint arXiv:2402.04236, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.169132Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c11baffdb17750a0006ea79efe8918a736926c64bfeb7db9d555c244b9b8a7a7","observation_id":"c9a368e4-f37a-4ffd-b1d6-20ad3b5f427f","resolution":{"observed_at":"2026-08-11T12:53:14.169132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T12:53:14.175515Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.175515Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:f2351d952c5aece9056ce2421c46fd4e270b23a5bee383d7fef7ed3bc6c59b40","observation_id":"d47f3c4d-f832-4c6b-a745-c38dbd5f852b","resolution":{"observed_at":"2026-08-11T12:53:14.175515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T12:53:14.182177Z","title":"Qwen2.5-VL technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.182177Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c0234fed1ef8ff47b461cf17f8437ce923fcdea5a9c80a01b39d23a8d2d02d93","observation_id":"25ad21de-9c81-4709-b03a-9f0f39708c29","resolution":{"observed_at":"2026-08-11T12:53:14.182177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T12:53:14.188571Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.188571Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:3c279c1ddec77f25d36adf56d6104ad2790751d33a61cc1cd361a58681a6ab1b","observation_id":"8c0aada3-d18d-4ebe-83af-b05f2c1bd462","resolution":{"observed_at":"2026-08-11T12:53:14.188571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-12T23:26:08.853045Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-11T12:53:14.194557Z","title":"Vision language models are blind.arXiv preprint arXiv:2407.06581, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.194557Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:7fc81aa9f7bd8e7b80d2e15982130a5ca441a7b5aa8b841610e1ae640d40e5fb","observation_id":"fa21b7df-5558-4e33-8163-a62a77acc62f","resolution":{"observed_at":"2026-08-11T12:53:14.194557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23678","snapshot_observed_at":"2026-08-11T12:53:14.200723Z","title":"Tarr, Aviral Kumar, and Katerina Fragkiadaki","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.200723Z"},"links":{"cited_paper":"/paper/2505.23678","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:72cd7200e69be415a70d7d6479bb58dac6e9ae444eefe6bb7f49e9aae2496440","observation_id":"b553977f-9a03-4e10-9724-7816c539dd03","resolution":{"observed_at":"2026-08-11T12:53:14.200723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.206226Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.206226Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c88b32e7cd17d9a40763281d77f5fb1ec2942f25ddb15f14d6efdecb277a587f","observation_id":"71aed7c4-6d94-4238-a052-da220eee155a","resolution":{"observed_at":"2026-08-11T12:53:14.206226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-08-13T00:45:26.212994Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-11T12:53:14.211374Z","title":"Visual CoT: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.211374Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:7ba3e87624da7150406155df672738fded05f2c46c3f103566397a7b88adbb26","observation_id":"eb554f4a-9642-4522-ac1f-13538d74085c","resolution":{"observed_at":"2026-08-11T12:53:14.211374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.216761Z","title":"HuggingGPT: Solving AI tasks with ChatGPT and its friends in Hugging Face","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.216761Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:0c8ef11715e1782281e9a6fcbb1f6edd705f4e1cb6010de3e2606fa346157f94","observation_id":"36606029-2231-4dbc-87b7-538e2926826a","resolution":{"observed_at":"2026-08-11T12:53:14.216761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-11T12:53:14.221402Z","title":"HybridFlow: A flexible and efficient RLHF framework.arXiv preprint arXiv:2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.221402Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:889c72bc7f569bb42e72ef151170d0c0c4b61d838a6c7e862eb985c366139a61","observation_id":"d80610d9-2730-4bd8-bb41-1c6a246f93d8","resolution":{"observed_at":"2026-08-11T12:53:14.221402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.226408Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.226408Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:593823e8270d5a8ff474cae7610d8a327dd8693d7cc176c357f4f6ca94b6b466","observation_id":"7039400c-ff0f-4515-a00c-e38454fb4b39","resolution":{"observed_at":"2026-08-11T12:53:14.226408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16475","last_updated":"2026-06-04T06:19:39Z","snapshot_observed_at":"2026-08-06T12:27:17.916076Z","submitted_at":"2026-03-17T13:01:44Z","title":"Breaking the Chain: A Causal Analysis of LLM Faithfulness to Intermediate Structures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16475","snapshot_observed_at":"2026-08-11T12:53:14.231434Z","title":"Breaking the chain: A causal analysis of LLM faithfulness to intermediate structures.arXiv preprint arXiv:2603.16475, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.231434Z"},"links":{"cited_paper":"/paper/2603.16475","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c9188a9be0c7c40b7f580b12cb0cb7d051fcbd64007de25aa68eee04b3fb3ee3","observation_id":"bd7094a6-99ef-4afb-b609-325ea8259745","resolution":{"observed_at":"2026-08-11T12:53:14.231434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-11T12:53:14.237048Z","title":"OpenThinkIMG: Learning to think with images via visual tool reinforcement learning.arXiv preprint arXiv:2505.08617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.237048Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:802eb98cc0f4026211657d77e4d3594ccfcf333569b41761b9924be6f1165099","observation_id":"2f895714-0304-4781-afac-8325cbee7e5e","resolution":{"observed_at":"2026-08-11T12:53:14.237048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-11T12:22:14.746398Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-08-11T12:53:14.243692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.243692Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:74929d708a3b2993af83c5224e670a05f56a177ef46bf7e57b4928004184b7c4","observation_id":"6adf3fcd-a92f-4e84-9f6c-f35f8fdca13d","resolution":{"observed_at":"2026-08-11T12:53:14.243692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16256","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:16.986166Z","title":"When thinking hurts: Mitigating visual forgetting via frame repetition.arXiv preprint arXiv:2603.16256, 2026","venue":null,"work_id":"d48673b0-60cb-4397-937c-8173cf1226e7","year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.249540Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:d25b5d101bd3caef1f99ee9bc93d0eb4ecc5907edb8399ef2dde061a6c5b6169","observation_id":"808134bd-c4aa-41ce-8ced-e241ff856bee","resolution":{"observed_at":"2026-08-11T12:53:16.994849Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10693","last_updated":"2026-04-20T08:48:59Z","snapshot_observed_at":"2026-08-11T17:27:36.503770Z","submitted_at":"2026-04-12T15:35:08Z","title":"FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2604.10693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10693","snapshot_observed_at":"2026-08-11T12:53:16.896915Z","title":"FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning","venue":"cs.AI","work_id":"cebc7e68-154b-4a10-8ee0-f473477b1ba4","year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.254925Z"},"links":{"cited_paper":"/paper/2604.10693","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:449c49d7a68b39bbd53f87c73188714eeaa4721857eba18452e2a05760d48ac7","observation_id":"33cfd61d-327a-47bf-831c-7f2f998d7ef9","resolution":{"observed_at":"2026-08-11T12:53:16.902776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.260904Z","title":"ViperGPT: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.260904Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:ee6a9eae8a28b0ffc8ae7fdbbcf482883e1942d89fbfd6fc9beb9a70577615ca","observation_id":"a6faa050-844b-4cd5-9dc9-5a37b4bcd364","resolution":{"observed_at":"2026-08-11T12:53:14.260904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.266490Z","title":"CV-Bench: A computer vision benchmark for evaluating visual perception in multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.266490Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e742e75b9d5a7e86848472ddca9af880202abab05f0d39526403d1e3c1fd68a6","observation_id":"c664eea2-5da5-491d-a904-af12e5d86968","resolution":{"observed_at":"2026-08-11T12:53:14.266490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.271924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.271924Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:a230a2298a014af115a9fc7da0b21e5f8376369845fce1ed33d8fdb816b2f080","observation_id":"984d86a0-d722-4cdd-a983-895defd786b0","resolution":{"observed_at":"2026-08-11T12:53:14.271924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.277132Z","title":"Journey before destination: Visual faithfulness in slow thinking.arXiv preprint arXiv:2512.12218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.277132Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e1890d5cb211372d9bccd15a82bb02a7e179c0d7ad274935dec791e8dd2f5754","observation_id":"cb4caa7c-52de-4d80-8dba-fa757ff24771","resolution":{"observed_at":"2026-08-11T12:53:14.277132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.282612Z","title":"GeoEyes: On-demand visual focusing for ultra-high-resolution remote sensing.arXiv preprint arXiv:2602.14201, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.282612Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1645d7eb26fea0d16f7b7619f000f223840729c25ea749cc6665bccdedc01bf3","observation_id":"aa0df45c-08c5-43d0-8474-d7483c923177","resolution":{"observed_at":"2026-08-11T12:53:14.282612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-11T12:53:14.289490Z","title":"Pixel-reasoner: Incentivizing pixel-scale reasoning with curiosity-driven reinforcement learning.arXiv preprint arXiv:2505.15966, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.289490Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e5e2300e03e327aa49d6c8a67f3f689b5c2ae439cd2af04614bf5da207568fb5","observation_id":"0fcc6dce-7fe1-493b-953e-1838a6248d78","resolution":{"observed_at":"2026-08-11T12:53:14.289490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.295877Z","title":"PLaT: Latent chain-of-thought as planning: Decoupling reasoning from verbalization.arXiv preprint arXiv:2601.21358, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.295877Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:ed4194c17c53f9896b73708376fc834f62950d361f7bc1bdf55947f6159d8487","observation_id":"431c9e90-1e5c-4855-8d17-1096829a3f45","resolution":{"observed_at":"2026-08-11T12:53:14.295877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.301424Z","title":"VAGEN: Reinforcing world model reasoning for multi-turn VLM agents.arXiv preprint arXiv:2510.16907, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.301424Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:eb9918d7deebd49ecbcc2b2125a36ef42f2dc684b9f4f704c6852adfa6c98603","observation_id":"13f7fe4e-f9e3-4b26-924d-51d354c8d659","resolution":{"observed_at":"2026-08-11T12:53:14.301424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.307438Z","title":"Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.307438Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:b24dafe6741789f733ed4229430759d597fd0844ab5f412d3561a8166fb32da7","observation_id":"155234b5-f117-43e0-ac3f-685adee465c4","resolution":{"observed_at":"2026-08-11T12:53:14.307438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.313080Z","title":"A practitioner’s guide to multi-turn agentic reinforcement learning.arXiv preprint arXiv:2510.01132, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.313080Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:339804fc2f9cd08f201d0bb0da4a603805c494eb0fbcc284e7d4559d286c03ba","observation_id":"ad4de20a-fa87-4e81-a3f1-935df8556f00","resolution":{"observed_at":"2026-08-11T12:53:14.313080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-08-12T22:56:08.608438Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-08-11T12:53:14.318402Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models.arXiv preprint arXiv:2408.15556, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.318402Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:6c32777c7cbf58687633f33c352cb3e5c6159bd64ddfd478543f484e6f66aa66","observation_id":"7e8456bd-7ef2-4fdb-86cb-b3b5d1e618a7","resolution":{"observed_at":"2026-08-11T12:53:14.318402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.324074Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.324074Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8ad91e7e56000e6a862a19fd99c095778f5946f956d62fb6205edfa7c049c2d1","observation_id":"f574102a-4bd5-4cf0-aaab-eeb6bc7aa745","resolution":{"observed_at":"2026-08-11T12:53:14.324074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12109","last_updated":"2025-08-16T17:15:39Z","snapshot_observed_at":"2026-08-05T19:32:10.280396Z","submitted_at":"2025-08-16T17:15:39Z","title":"Simple o3: Towards Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12109","snapshot_observed_at":"2026-08-11T12:53:14.330057Z","title":"Simple o3: Towards interleaved vision-language reasoning.arXiv preprint arXiv:2508.12109, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.330057Z"},"links":{"cited_paper":"/paper/2508.12109","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:2ce3ce8bfadd6ccc13bbd119bc8d4884da2a6af1e355bed0906646c88f60045d","observation_id":"11876701-c04c-48cb-9602-4d5af4eb6f62","resolution":{"observed_at":"2026-08-11T12:53:14.330057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-10T06:52:44.809057Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-11T12:53:14.335916Z","title":"RAGEN: Understanding self-evolution in LLM agents via multi-turn reinforcement learning.arXiv preprint arXiv:2504.20073, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.335916Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:a6bc3981d687801cc103a8fc46178e6edf24e5c9116eb1f4fb191cc85e6a55a8","observation_id":"672af4c4-9a5f-40d2-abde-ad12cb180fd6","resolution":{"observed_at":"2026-08-11T12:53:14.335916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-12T23:34:16.774520Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-11T12:53:14.341547Z","title":"CharXiv: Charting gaps in realistic chart understanding in multimodal LLMs.arXiv preprint arXiv:2406.18521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.341547Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:7c3cc136605288d47925760b1dd9765b3311561594ffe8af09d8dfd3a4c104a8","observation_id":"58bc7e5f-585b-444a-b826-0f46909038fb","resolution":{"observed_at":"2026-08-11T12:53:14.341547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.346906Z","title":"V-FAT: Benchmarking visual fidelity against text-bias.arXiv preprint arXiv:2601.04897, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.346906Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:4b17e9839701ff75d3a1cbafb8864f30b932897f58cd68a8e00c0059dbaa6529","observation_id":"f6834941-8cc1-470f-bd19-d04bb69d18b4","resolution":{"observed_at":"2026-08-11T12:53:14.346906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.352064Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.352064Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:99042f3a6f1a37c3224c29a6b8a7821a132db8437131782cbbc429389fbdf9dd","observation_id":"75cb0d3c-04e6-46b5-a8e7-454ba0800c7b","resolution":{"observed_at":"2026-08-11T12:53:14.352064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.357126Z","title":"Zooming without zooming: Region- to-image distillation for fine-grained multimodal perception.arXiv preprint arXiv:2602.11858, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.357126Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:813303ed68d97dd5390ae6aae6d8fe03ebd1f36c64421a261f0cf80b22ab6845","observation_id":"8614fd79-8787-43d5-83b9-21608da229f4","resolution":{"observed_at":"2026-08-11T12:53:14.357126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.362216Z","title":"Visual generation unlocks human-like reasoning through multimodal world models.arXiv preprint arXiv:2601.19834, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.362216Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:cf8c57db080880338b51d20c0d5e0b53e9335bdfc325166449fd55b56e497a2e","observation_id":"10131f61-7daf-46c1-82f6-f0f69697db60","resolution":{"observed_at":"2026-08-11T12:53:14.362216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.367385Z","title":"VTool-R1: VLMs learn to think with images via reinforcement learning on multimodal tool use.arXiv preprint arXiv:2505.19255, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.367385Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:22d5d503dee31aea6804831994f1d9369da5852ca28a569c41e7b03a60410245","observation_id":"812332c9-4101-4395-ad7a-532e7f106164","resolution":{"observed_at":"2026-08-11T12:53:14.367385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-11T12:53:14.372654Z","title":"V*: Guided visual search as a core mechanism in multimodal LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.372654Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:9dab980cf508577fcc2cb39e4e40d4d004f24ee6eaeb8a93a53bb0fc5e2beb9e","observation_id":"c1358137-74bd-4884-b10f-9687c7390116","resolution":{"observed_at":"2026-08-11T12:53:14.372654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.378336Z","title":"Tool-augmented policy optimization.arXiv preprint arXiv:2510.07038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.378336Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:55b8ffd1f9a74c8841e90dda266894360305d84511de146894ef0a53f4219477","observation_id":"39fdb19d-0830-48e0-bb5b-af6e36d48e4a","resolution":{"observed_at":"2026-08-11T12:53:14.378336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02477","last_updated":"2024-03-28T23:37:24Z","snapshot_observed_at":"2026-08-09T20:31:51.939524Z","submitted_at":"2023-07-05T17:50:42Z","title":"Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02477","snapshot_observed_at":"2026-08-11T12:53:14.384423Z","title":"Reasoning or reciting? exploring the capabilities and limitations of language models through counterfactual tasks.arXiv preprint arXiv:2307.02477, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.384423Z"},"links":{"cited_paper":"/paper/2307.02477","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e562cbb72795593bf3436689365fa5f90d08c5b9d3a7f5f016a4ca4f7d1c41a2","observation_id":"d2e8fa83-702f-44e8-bdb0-0b664623ccfd","resolution":{"observed_at":"2026-08-11T12:53:14.384423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-11T12:53:14.390585Z","title":"LLaVA-CoT: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.390585Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:cfb5e20e9307dcb01e15fba1a4a3ea5f32f1aea5e2d99a281b9e124ee1c97025","observation_id":"e0bf9a99-100f-4ea1-aa7d-15c558030ec7","resolution":{"observed_at":"2026-08-11T12:53:14.390585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08545","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-08-10T23:18:23.568914Z","submitted_at":"2026-04-09T17:59:57Z","title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08545","snapshot_observed_at":"2026-08-11T12:53:14.396078Z","title":"Act wisely: Cultivating meta-cognitive tool use in agentic multimodal models.arXiv preprint arXiv:2604.08545, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.396078Z"},"links":{"cited_paper":"/paper/2604.08545","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:711487d72fdcfd070e478d3a620aa5f5bb537002c85d31837e2e7e94ed0e9047","observation_id":"68cb5366-89ba-4258-9f1a-99d967af8c4c","resolution":{"observed_at":"2026-08-11T12:53:14.396078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-11T12:53:14.403481Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in GPT-4V.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.403481Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:5de485cea9096ef21c970a4d2723455b0e50bdff2a760f60be5da9f53ec3fae1","observation_id":"51316cec-d858-4612-af50-38963eb96922","resolution":{"observed_at":"2026-08-11T12:53:14.403481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-11T12:53:14.409420Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.409420Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:05c7f62602169d35cd48c472e34c0dee0f1e3585a59fe88be9d445cc6c767b53","observation_id":"c22ace32-3b90-4012-b5f8-9e466331462e","resolution":{"observed_at":"2026-08-11T12:53:14.409420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-10T11:05:10.491989Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-08-11T12:53:14.415257Z","title":"VisionThink: Smart and efficient visual language model via reinforcement learning.arXiv preprint arXiv:2507.13348, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.415257Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:ea89d6e581e055f156a53943d7c1d71288f3d0aa10a44547752c0441c9a532ba","observation_id":"5e606f51-b262-42b5-8073-9e895eb919f4","resolution":{"observed_at":"2026-08-11T12:53:14.415257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03019","last_updated":"2025-07-02T14:59:35Z","snapshot_observed_at":"2026-08-12T06:11:43.310913Z","submitted_at":"2025-07-02T14:59:35Z","title":"Look-Back: Implicit Visual Re-focusing in MLLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03019","snapshot_observed_at":"2026-08-11T12:53:14.422649Z","title":"Look-back: Implicit visual re-focusing in MLLM reasoning.arXiv preprint arXiv:2507.03019, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.422649Z"},"links":{"cited_paper":"/paper/2507.03019","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:7ed6722355d5dfe926fe8ca92a7050042bfe7363c277ba610ccd3686edb5e8fa","observation_id":"af5e4430-ad7c-4533-b666-a57b79c4825d","resolution":{"observed_at":"2026-08-11T12:53:14.422649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-11T16:12:19.023322Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"cited_work":{"arxiv_id":"2604.06777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06777","snapshot_observed_at":"2026-08-11T12:53:15.658267Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","venue":"cs.CV","work_id":"54731e1a-9618-4838-bc60-2c53f799ed21","year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.428800Z"},"links":{"cited_paper":"/paper/2604.06777","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:2c236eabbcb252322540780cf96beb53036cfeee8f5151742a40979b27878b67","observation_id":"c46a5d03-1cee-489d-98bd-52fb90f9d5b4","resolution":{"observed_at":"2026-08-11T12:53:15.665161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.434700Z","title":"Thinking with images via self-calling agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.434700Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:0ef53e2aad9471503aa90d880be87feb7f8b77a8f4603fec447ee2fb5c05fca8","observation_id":"6dc2fa7b-8836-4961-aa4b-e74d4e6e85d4","resolution":{"observed_at":"2026-08-11T12:53:14.434700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.440324Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.440324Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e2ad0f0dca02248743271d4ca5bf35c93a24895c9a90d17b24f22a68852582c8","observation_id":"ebbc4565-7328-45a9-9e9e-c80012b9984e","resolution":{"observed_at":"2026-08-11T12:53:14.440324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.445645Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.445645Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:c04f7ec0c93fdfc4e029182050537c6afd40aa603b527ed5f1a5315ede0a7bb3","observation_id":"6e03bf6e-d596-4191-833a-6f05b55e852a","resolution":{"observed_at":"2026-08-11T12:53:14.445645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.450944Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.450944Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1113b818ba3b0433d2ab23d7db542767d9ceb7fa02bc0f345d55cef1d33c5966","observation_id":"bb86f08f-a4d6-4b04-937e-b32d0aaac4c4","resolution":{"observed_at":"2026-08-11T12:53:14.450944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.456716Z","title":"ProRL agent: Rollout-as-a-service for reinforcement learning training of multi-turn LLM agents.arXiv preprint arXiv:2603.18815, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.456716Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:2eb704fc1bf42a5ef22a13c27f69555d25f9b93bcb0c2afe09654f485e7655c9","observation_id":"93488707-e50d-4f90-8a7d-95b8d82a412d","resolution":{"observed_at":"2026-08-11T12:53:14.456716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.462467Z","title":"MM-CoT: A benchmark for probing visual chain-of-thought reasoning.arXiv preprint arXiv:2512.08228, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.462467Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:96c619f634c905b9bd6ba8b58afcc3191caba25e8584d6eb980a27bc35c63fb0","observation_id":"1da67c1b-6c4a-472f-93ea-6f3d8f059e62","resolution":{"observed_at":"2026-08-11T12:53:14.462467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-11T01:31:42.961611Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-11T12:53:14.468007Z","title":"LLaVA-Mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.468007Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:8c3bfb3f2d2179dbca57ea8c4ed48922a0cadf9b6d87f0cf55c547b63f44e1dc","observation_id":"1cde152f-f8de-45dd-8e0e-f00f4a94f582","resolution":{"observed_at":"2026-08-11T12:53:14.468007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-11T12:53:14.474606Z","title":"MME-RealWorld: Could your multimodal LLM challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.474606Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:7c1555c219d749ef7626369b37b21a8d2063c1b4f4f0a1527f3484d69dabac82","observation_id":"ef2d5d0a-b1e9-435e-9982-f1221d152fad","resolution":{"observed_at":"2026-08-11T12:53:14.474606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-08-11T12:53:14.480733Z","title":"Thyme: Think beyond images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.480733Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1d8a48c497920214c0f4e0588e14279af13c31ab197c41d937af73f2a88e2fa6","observation_id":"c12feb7b-3ba7-47e1-a0bc-5cb150c124f2","resolution":{"observed_at":"2026-08-11T12:53:14.480733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.486447Z","title":"Skywork-r1v4: Toward agentic multimodal intelligence through interleaved thinking with images and deepresearch.arXiv preprint arXiv:2512.02395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.486447Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:dd00b086c3c4d8ee9440e99255df81ac8c3640f908d2cb78a23081958abee1c4","observation_id":"4fb149dd-5d29-49f4-a574-6c1c48b07001","resolution":{"observed_at":"2026-08-11T12:53:14.486447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:53:14.491968Z","title":"CM2: Reinforcement learning with checklist rewards for multi-turn and multi-step agentic tool use.arXiv preprint arXiv:2602.12268, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.491968Z"},"links":{"citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:e76da2045394279e4a1c516524a72d6b318c53faec317686908ebd22f8620016","observation_id":"3a376dd0-d944-496d-b3da-cffe00b77a20","resolution":{"observed_at":"2026-08-11T12:53:14.491968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T12:53:14.497323Z","title":"Multimodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.497323Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:b94fdfccbb2a52572020262b743ce4a70d674c419ca8eb16001f9f5f4d7152bb","observation_id":"abebf7fd-87a9-4b5f-ad26-07e75afc7002","resolution":{"observed_at":"2026-08-11T12:53:14.497323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12506","last_updated":"2026-05-21T07:28:16Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T01:12:00Z","title":"On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12506","snapshot_observed_at":"2026-08-11T12:53:14.503030Z","title":"On robustness and chain-of-thought consistency of RL-finetuned VLMs.arXiv preprint arXiv:2602.12506, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.503030Z"},"links":{"cited_paper":"/paper/2602.12506","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:ca29c6380b40e22bb3a2286a6873575f2bb19006b6fab4c60ba8e8054f39d326","observation_id":"754fb110-bb38-4730-85a6-4d1842ee219b","resolution":{"observed_at":"2026-08-11T12:53:14.503030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:15:46.541426Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":129},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 129 outbound references and 0 inbound Pith citation observations for arXiv:2608.09682."}