{"as_of":"2026-08-15T14:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efbece79b2d6b3ce851ed53e9f3288e607721f489433953240c999e2e1875755","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T02:45:28.806859Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28595/citation-record","integrity":"/paper/2607.28595/integrity","json":"/paper/2607.28595/citation-record.json","paper":"/paper/2607.28595"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T02:45:28.572906Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.572906Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:2425f31475a0f0e9a60bfba0ce21254309483a13e7dc55ee3111c95237de32e8","observation_id":"f56f4ce3-a20a-4f98-992f-401a0d643fc1","resolution":{"observed_at":"2026-07-31T02:45:28.572906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T02:45:28.577184Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.577184Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:62fc415365c79e9cd38b2114b449e3b1666a373aeacd26918975d448882a0ae9","observation_id":"3ad2475c-6393-4ffc-b735-2c1a2b186bf1","resolution":{"observed_at":"2026-07-31T02:45:28.577184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-10T02:33:01.623850Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-31T02:45:28.580613Z","title":"Babyvision: Visual reasoning beyond language","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.580613Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:d63555dac43b414eaea96a7f5a6a15c12b10a2cdf65995e118cc0825460880c6","observation_id":"52f1f3d1-c9a0-418c-9ea2-43d2dd02a6fd","resolution":{"observed_at":"2026-07-31T02:45:28.580613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.583636Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.583636Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:303cf28056f240696e0d469ff4eb91d6ff8dce0dcbdf335138cf76ae9ece0ea4","observation_id":"47c4a280-2b81-4b6f-8587-5ab501711019","resolution":{"observed_at":"2026-07-31T02:45:28.583636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.586821Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.586821Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:a0d8492c1cddf7019ebc5d1a30c322540d883e4625580225bb9dcfbf9da3fbc9","observation_id":"2c34196c-47d9-4041-96d8-3b9f04b581de","resolution":{"observed_at":"2026-07-31T02:45:28.586821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.589693Z","title":"Gemini 3 flash.https://deepmind.google/models/ model-cards/gemini-3-flash/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.589693Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:c9504f05b381c2cad5677977eadfa64bf6cf1b38c000b3a2e0e0eda612c3c8f7","observation_id":"03889ca6-0fa5-41e9-94b9-85a991881575","resolution":{"observed_at":"2026-07-31T02:45:28.589693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.592635Z","title":"Gemini 3.1 Pro: Model Card.https://deepmind.google/ models/model-cards/gemini-3-1-pro/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.592635Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:82581c5a6369d1fa22fb95ec6a6713c360a9359bc2ca20bc48719a0f97cedd5e","observation_id":"49c5fe79-91d0-413c-b79d-f1eb21506a92","resolution":{"observed_at":"2026-07-31T02:45:28.592635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02357","last_updated":"2026-06-01T15:04:25Z","snapshot_observed_at":"2026-08-06T12:35:15.393277Z","submitted_at":"2026-06-01T15:04:25Z","title":"Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02357","snapshot_observed_at":"2026-07-31T02:45:28.595072Z","title":"Do multimodal agents really benefit from tool use? a systematic study of capability gains.arXiv preprint arXiv:2606.02357, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.595072Z"},"links":{"cited_paper":"/paper/2606.02357","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:cf66ce37a637e4734da0c3a4dc4a383fa2dd58b6b01f5fed58dc135d9c56c1ba","observation_id":"63ebea04-eff5-4754-93fe-408827e5e25a","resolution":{"observed_at":"2026-07-31T02:45:28.595072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.597828Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.597828Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:0445d7e2dd408d1861c7646520ae340cef374800fad35e91d6aa4a0686af6cfd","observation_id":"f5b2e615-6c47-4719-93ae-395fbfa041cd","resolution":{"observed_at":"2026-07-31T02:45:28.597828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.600434Z","title":"Deep- eyesv2: Toward agentic multimodal model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.600434Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:7a0117ae7ea4893ebcbe3ac4ab45fcb31a8dad83f06efcda010acebae7a3bdb4","observation_id":"88f26d40-cb8c-4c6d-acc5-0c71e6756db8","resolution":{"observed_at":"2026-07-31T02:45:28.600434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.603049Z","title":"Codev: Code with images for faithful visual reasoning via tool-aware policy optimization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.603049Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:05dd8cfc17f3c6de45b210b39f983e3f57cb7a5c87486384e8950f0ee11662f7","observation_id":"94874c9f-8a53-42e8-a242-eaf352d6884a","resolution":{"observed_at":"2026-07-31T02:45:28.603049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-07-31T02:45:28.605521Z","title":"Mini-o3: Scaling up reasoning patterns and interaction turns for visual search.arXiv preprint arXiv:2509.07969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.605521Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:32da5aa5b746f58d6add1715a234171022785b65a00173dd4991e15b2454bd07","observation_id":"bbcf8ea9-ad85-4c66-91cf-62c90d036a40","resolution":{"observed_at":"2026-07-31T02:45:28.605521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.608319Z","title":"Tir-bench: A comprehensive benchmark for agen- tic thinking-with-images reasoning.arXiv preprint arXiv:2511.01833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.608319Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:fb7be260b39b2e5fe7f7f9c4718d4696bc6987a05e1027810eaecc770754d1c4","observation_id":"88b48036-eb45-4c7a-81b8-e4065a270d14","resolution":{"observed_at":"2026-07-31T02:45:28.608319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.610922Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.610922Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:8e98704b6fee500b4f3dcd4c1129193217a82dfb66cef1816a2bcdbc1e0a6dd4","observation_id":"e158821a-eb11-4498-a520-58b1e8b14fbc","resolution":{"observed_at":"2026-07-31T02:45:28.610922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.613540Z","title":"Mathvista: Evaluating mathemati- cal reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.613540Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:20418145365023b24a4dd5de93310b52dd7956fd8bfa4198e66df88af4602ca0","observation_id":"d449e6fb-18c7-40d8-8994-12bc5ee509f7","resolution":{"observed_at":"2026-07-31T02:45:28.613540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.616171Z","title":"What does vision tool-use reinforcement learning really learn? disentangling tool-induced and intrinsic effects for crop-and-zoom","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.616171Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:2a4a473f4f5878bef42a95fc4122ec760e09a6327c9e2bac7632eb958f431aa3","observation_id":"c1b6ff31-51cf-4e57-937a-0faaf919a127","resolution":{"observed_at":"2026-07-31T02:45:28.616171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.618769Z","title":"Chartqapro: A more diverse and challenging benchmark for chart question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.618769Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:ccd78e5ce80d0efee38082d15d704b276766e907ffec0a73acc40fc70d33f09c","observation_id":"bd8e4216-d41f-46f8-9c28-7d228fb8c16b","resolution":{"observed_at":"2026-07-31T02:45:28.618769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-14T15:23:56.583688Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-31T02:45:28.621215Z","title":"Adaptive guidance accelerates reinforcement learning of reasoning models.arXiv preprint arXiv:2506.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.621215Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:bbdb1758cd965262a28fc80401a2a3550832c3c078ceed2a473735eefc138991","observation_id":"44f73572-76ad-4cac-a237-d43b714ec9a0","resolution":{"observed_at":"2026-07-31T02:45:28.621215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.624249Z","title":"Cogcom: A visual language model with chain-of- manipulations reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.624249Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:26f6cccfe48aac4fdd3e3d639ed7425bb57e1dbf505dea6c42bcd09b88e25bb5","observation_id":"c4e80e5c-8a3b-465d-b450-5aeeb78e4064","resolution":{"observed_at":"2026-07-31T02:45:28.624249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.626748Z","title":"V-thinker: Interactive thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.626748Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:40752cf1e34627cb4c8e839b5e6f54aa863b00c9280dc2d0068823f516d7629f","observation_id":"43799434-24a1-4069-b89a-4a6be6d0f474","resolution":{"observed_at":"2026-07-31T02:45:28.626748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04917","last_updated":"2026-06-18T15:34:46Z","snapshot_observed_at":"2026-08-11T18:23:10.166901Z","submitted_at":"2026-04-06T17:56:25Z","title":"Vero: An Open RL Recipe for General Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04917","snapshot_observed_at":"2026-07-31T02:45:28.629138Z","title":"Vero: An open rl recipe for general visual reasoning.arXiv preprint arXiv:2604.04917, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.629138Z"},"links":{"cited_paper":"/paper/2604.04917","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:4d60c0fd2d3dd54fb92089109e74e06d5b9bd601eadcccabc0d7103b1ba84c92","observation_id":"953cf440-a4c9-4ddf-982e-25a4f36da276","resolution":{"observed_at":"2026-07-31T02:45:28.629138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.631786Z","title":"Tarr, Aviral Kumar, and Katerina Fragkiadaki","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.631786Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:e8e16615cb6979f8a312d95f4da4d8e05e2f7062730d1b0a09ae58d9a9d34ff5","observation_id":"adbe7472-8132-4f29-96a2-c3a856f99321","resolution":{"observed_at":"2026-07-31T02:45:28.631786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T02:45:28.634206Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.634206Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:f2e0267a36cd19eb3773a7a1587c3a7247bb1fd685ddcbd81881790d9a4540f8","observation_id":"2fcb59dc-9646-4e74-9ae7-6760df43ed63","resolution":{"observed_at":"2026-07-31T02:45:28.634206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-31T02:45:28.637148Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.637148Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:b499d9c3ad912df01c1aa6ec8016b5e891c9df580d00d9ba2a5a920605a4af43","observation_id":"2c6a8b91-b34b-4d55-bc16-fd31a665bf5d","resolution":{"observed_at":"2026-07-31T02:45:28.637148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.639778Z","title":"Mavors: Multi-granularity video repre- sentation for multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.639778Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:c8b7f572e17b54dcf5f1568f56205d4c1f0bd403ec182fac2a323ea78d2a1b6a","observation_id":"527d3cd2-3576-4e45-902a-0f13174ab859","resolution":{"observed_at":"2026-07-31T02:45:28.639778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-31T02:45:28.642281Z","title":"Megatron-lm: Training multi-billion parameter language models using model par- allelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.642281Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:6a983d0e9a52296c0998627ad2c2602a58fea5a3a958f1b717548f693929e19e","observation_id":"7b7134e3-50b5-4a0d-b17a-6870c7939b9b","resolution":{"observed_at":"2026-07-31T02:45:28.642281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.645248Z","title":"Codedance: A dynamic tool-integrated mllm for executable visual reason- ing.arXiv preprint arXiv:2512.17312, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.645248Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:af5d772a8b03f286c75ad0168c690941cecb45b9e11222c2858652d222f6d2dc","observation_id":"1a1bd232-68f8-4b03-a55a-33150744a8a7","resolution":{"observed_at":"2026-07-31T02:45:28.645248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10342","last_updated":"2025-04-30T14:45:01Z","snapshot_observed_at":"2026-08-07T16:05:50.340309Z","submitted_at":"2025-04-14T15:50:39Z","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10342","snapshot_observed_at":"2026-07-31T02:45:28.647722Z","title":"Visualpuz- zles: Decoupling multimodal reasoning evaluation from domain knowledge.arXiv preprint arXiv:2504.10342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.647722Z"},"links":{"cited_paper":"/paper/2504.10342","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:1471115e6f8eb3d96513ebcdf8b4d3c07189edb0dba4aeb28f59bc30708daee5","observation_id":"6b89ba06-8336-4c64-8b10-f79a53b39f0d","resolution":{"observed_at":"2026-07-31T02:45:28.647722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.650544Z","title":"Pixel reasoner: In- centivizing pixel space reasoning via curiosity-driven reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.650544Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:ef1b3ac32f891ab0c69c3ddf82f09e7c0c81aba3a6390fa7ec5703907b78302d","observation_id":"a2211762-9c6f-4c68-a745-0747bf52ce8d","resolution":{"observed_at":"2026-07-31T02:45:28.650544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-07-31T02:45:28.652956Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning.arXiv preprint arXiv:2505.08617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.652956Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:018101875f525ccfb129ff2a489f98a21e0f0abd68d7c587215613522c4e59f6","observation_id":"de4762bb-fa75-4014-a8dd-3c9342da3222","resolution":{"observed_at":"2026-07-31T02:45:28.652956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.655849Z","title":"Agentvista: Evaluating multimodal agents in ultra-challenging realistic visual scenarios.arXiv preprint arXiv:2602.23166, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.655849Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:b385a22cdb4d487b191e73f55de586f64f497cecaaa83ac4270c1171609ef5df","observation_id":"ba5d70e8-f92f-4510-8d44-0c8b79ffe84c","resolution":{"observed_at":"2026-07-31T02:45:28.655849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.658361Z","title":"Game-rl: Synthesizing multimodal verifiable game data to boost vlms’ general reasoning.arXiv preprint arXiv:2505.13886, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.658361Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:f9f216cbcfa9dd6255de85bfc061fc59e64c8052fd98bc3799bcdb7054a6eb6c","observation_id":"0ef0366d-2e5c-4234-b987-a5d035300038","resolution":{"observed_at":"2026-07-31T02:45:28.658361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.661005Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.661005Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:9672e854caf241b17ff02697bb19dfd802b134141ffb268c0f98eab8339de663","observation_id":"09e21fdd-2760-4efc-b433-5ebe9d85e668","resolution":{"observed_at":"2026-07-31T02:45:28.661005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-15T04:47:59.605455Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16918","snapshot_observed_at":"2026-07-31T02:45:28.663533Z","title":"Adatooler-v: Adaptive tool-use for images and videos.arXiv preprint arXiv:2512.16918, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.663533Z"},"links":{"cited_paper":"/paper/2512.16918","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:ba70b9b913f03b0dc99db5c135ebf2ce959a5f24c9f9e270522ccf45a36d3b0d","observation_id":"389bd31a-a17d-470f-9d2b-8523ec521cf9","resolution":{"observed_at":"2026-07-31T02:45:28.663533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.666643Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.666643Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:999bb4d9a02d688da71b8c1ce67ec270bd9ba9e6291adb6ab8639b289c2825b7","observation_id":"40ac1b5b-ab6a-4a45-9b86-9aff181e1c2a","resolution":{"observed_at":"2026-07-31T02:45:28.666643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.669221Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.669221Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:9db63238544400605e9a1aab929c14b602a400bcfb806eed7a61a5cf962d1282","observation_id":"a67f7c40-d932-4b55-a677-e2d37e1f26df","resolution":{"observed_at":"2026-07-31T02:45:28.669221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.671771Z","title":"Monet: Reasoning in latent visual space beyond images and language.arXiv preprint arXiv:2511.21395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.671771Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:ff53b5557cce5fdbf7bb92ed300847f7682f80ff735ca1e8bfce15e431334f90","observation_id":"8fdb219b-c773-4c1c-a0a3-14b135fc928f","resolution":{"observed_at":"2026-07-31T02:45:28.671771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.674232Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.674232Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:72cec6ffe41dc81bd570454a5ea90ad775221509bf9cfc1de1d4bd8a753a68ea","observation_id":"2f146334-1353-4426-8eab-29b9b2fffe81","resolution":{"observed_at":"2026-07-31T02:45:28.674232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.676776Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.676776Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:01a0774cebbd5440cc449d2d6534c106dda2e773eb3621ba0bfbf6b656149839","observation_id":"1de094e6-1267-4e90-9c1d-53e7018a05b3","resolution":{"observed_at":"2026-07-31T02:45:28.676776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.679355Z","title":"RealWorldQA.https://huggingface.co/datasets/xai-org/ RealworldQA, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.679355Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:b3d80f476aadff54131fd921372c4e8858ae2018db5bfd3effe50f3f5e2d1c67","observation_id":"a04476fa-5229-489e-8479-8c7cae3830bb","resolution":{"observed_at":"2026-07-31T02:45:28.679355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08545","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-08-10T23:18:23.568914Z","submitted_at":"2026-04-09T17:59:57Z","title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08545","snapshot_observed_at":"2026-07-31T02:45:28.681811Z","title":"Act wisely: Cultivating meta-cognitive tool use in agentic multimodal models.arXiv preprint arXiv:2604.08545, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.681811Z"},"links":{"cited_paper":"/paper/2604.08545","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:86f34568cfb3a777a5545e2a767da7ae20a5d57aebe217a0ffb318f96f4327dc","observation_id":"e21fe376-6fce-48b1-ae9a-58a89fe1128a","resolution":{"observed_at":"2026-07-31T02:45:28.681811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.684618Z","title":"Position: Your VLM may not be thinking with interleaved images","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.684618Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:603b1a637c441120317bbd59a0478ea31f9b40a37ce89293290b7697f7a59c8a","observation_id":"4ea6e06d-a2ab-4349-9a6b-858e3a176dbf","resolution":{"observed_at":"2026-07-31T02:45:28.684618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.687874Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.687874Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:5d223caa74339d5f9556c4cfe349261ea1a682877340b9a169d53e779e745d44","observation_id":"287dad20-df4c-4143-8bb4-4f189ae76de4","resolution":{"observed_at":"2026-07-31T02:45:28.687874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.690467Z","title":"Thyme: Think beyond images","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.690467Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:6f23dfa6741b15c783412d0b21e007be14b4b6838a92221a396fe383adba3aaf","observation_id":"f741e33d-8ee2-426a-9343-ec3333f347c6","resolution":{"observed_at":"2026-07-31T02:45:28.690467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.693046Z","title":"Hrscene: How far are vlms from effective high-resolution image understanding? InICCV, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.693046Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:34c271064dbb7285cf0bfdf95f89a99b91ef796b757756d604ad9fa3539d3b9f","observation_id":"6d2aae7e-0ea5-4e7b-be9a-2ae0bb25adaf","resolution":{"observed_at":"2026-07-31T02:45:28.693046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.695407Z","title":"Pyvision-rl: Forging open agentic vision models via rl.arxiv preprint arxiv:2602.20739, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.695407Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:9bc75449eaa94591883af1f2aadfc8c01a73cfeefee99998c81b7c5807c3512f","observation_id":"cf2cda23-47e6-4e56-a544-3098b1644db9","resolution":{"observed_at":"2026-07-31T02:45:28.695407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05517","last_updated":"2025-05-19T06:50:53Z","snapshot_observed_at":"2026-08-13T01:59:11.269836Z","submitted_at":"2024-08-10T11:00:13Z","title":"SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05517","snapshot_observed_at":"2026-07-31T02:45:28.697827Z","title":"Swift:a scalable lightweight infrastructure for fine-tuning.arXiv preprint arXiv:2408.05517, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.697827Z"},"links":{"cited_paper":"/paper/2408.05517","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:b8a7cc95afdd8f394bf86ce54d59edb5e3ab60d1e50ace560cb449dc6f447e9b","observation_id":"c6c228fe-01d3-4654-97d2-df6d8e3e858f","resolution":{"observed_at":"2026-07-31T02:45:28.697827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.700631Z","title":"Chain-of-focus prompting: Leveraging sequential visual cues to prompt large autoregres- sive vision models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.700631Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:65c1a153597649b6b09abd5597408f6466b4506cce73b6b213121fd810b6032e","observation_id":"35e422da-b073-42c1-973c-dc239c450aad","resolution":{"observed_at":"2026-07-31T02:45:28.700631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.703141Z","title":"Vtc-bench: Evaluating agentic multi- modal models via compositional visual tool chaining.arXiv preprint arXiv:2603.15030, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.703141Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:91615231f3989f715defc261148d8c6472f69fc19fb1fe98391b70f75b01a24b","observation_id":"e5fb761e-292a-4ff6-8258-445359099750","resolution":{"observed_at":"2026-07-31T02:45:28.703141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.706071Z","title":"Retention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.706071Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:499037ec952a95fd078451204c1736c275cb2b9e3844ebfef3a20a6c41548319","observation_id":"e283a379-a6d1-492f-8588-806fe4e60f67","resolution":{"observed_at":"2026-07-31T02:45:28.706071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.709130Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.709130Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:659a070dbd729d126397fc35e5edfced254c780150965bdbe09ef7b3fcab88c7","observation_id":"8bb8e1ba-b7fc-445b-9999-b2e6d93d00c6","resolution":{"observed_at":"2026-07-31T02:45:28.709130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.711746Z","title":"Original question images use stable ids like q0, q1, and images returned by earlier code calls use stable ids like g0, g1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.711746Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:f2de927ae058944e36c66f7ba69a375692917ccc173e9d022f42aa315e357431","observation_id":"f97874b0-1497-4adb-804b-d85d924f96c2","resolution":{"observed_at":"2026-07-31T02:45:28.711746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.714376Z","title":"For example: annotated = get_image(\"q0\").copy()","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.714376Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:a622c04df6689ea103fd4aaeed6ea6d6945a30fdd18ba478dd8db2ecd31796eb","observation_id":"e27d8c12-2499-4c76-b4cf-c7e7884f604d","resolution":{"observed_at":"2026-07-31T02:45:28.714376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.716990Z","title":"If the current call should return a numeric result, the last line should be the numeric object itself, such as result","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.716990Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:937248db9610730327ab3613f5cd9efa1a71c1929f6393bf31aca9cc269c6585","observation_id":"cee45430-5898-4b3f-958c-d5e737bb7dbd","resolution":{"observed_at":"2026-07-31T02:45:28.716990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.719651Z","title":"Use Python code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.719651Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:a4b3a93de55646715c46a87f7bcde0f682f1c4156400f0c504db6399b9872594","observation_id":"21cc2461-cffe-457e-a867-b715eea560b0","resolution":{"observed_at":"2026-07-31T02:45:28.719651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.722348Z","title":"It is not something you should generate yourself","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.722348Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:065bff456e4f5272373876162b51f371a12b9bafd75a3a47cae5287321b86914","observation_id":"73930723-dec4-41b8-a427-c0242503e958","resolution":{"observed_at":"2026-07-31T02:45:28.722348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.724852Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.724852Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:0fdb0b0762ec8c5d2dd8f3ae1b717ba8f0c4024f83481659e481db3245ab2d91","observation_id":"ef9e1152-14a7-48c9-a488-0d8411ff662c","resolution":{"observed_at":"2026-07-31T02:45:28.724852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.727297Z","title":"After that, you may continue with additional <tool_call> -> <tool_response> -> <observation> cycles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.727297Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:c91124f8c0ffbf3141bbd314bdbd71cebeae9f256a706b0a36c69201aa870b4f","observation_id":"b6a5a8e6-11ea-43b5-a58b-039cb925a8de","resolution":{"observed_at":"2026-07-31T02:45:28.727297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.729967Z","title":"q0\").copy() draw = ImageDraw.Draw(annotated) draw.rectangle((600, 290, 660, 380), outline=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.729967Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:bdaa34673eb5234f262cfcca387d41fa38eade4cff11a463ae2927ae91d2123d","observation_id":"7815045d-5fb0-4cb1-9d52-576387c63d44","resolution":{"observed_at":"2026-07-31T02:45:28.729967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.732686Z","title":"Work in progress","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.732686Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:34aed7914fd2dcfba4e49b0cd8efdce828e137d8f5220f5c8126ce006619f9c4","observation_id":"58918079-77b7-49ed-ab0a-e69a77af3b4a","resolution":{"observed_at":"2026-07-31T02:45:28.732686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.735233Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.735233Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:f70ce706043d4a31e8993d3fdf2600a0ce0d367cd40df25415abf11df71d75a2","observation_id":"9795a361-567c-4b45-9b9e-15562723c015","resolution":{"observed_at":"2026-07-31T02:45:28.735233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.737951Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.737951Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:9a8f61d0482323ee14081b9056618bc16bb207b41e392d3a179b50e3ed14aab4","observation_id":"2140fda0-a99d-4439-8270-067d962d2f2b","resolution":{"observed_at":"2026-07-31T02:45:28.737951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.740437Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.740437Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:6c02dfd4e482d08cc1d78e0da4d1386b8ce9f511b46da194b667bef95586e203","observation_id":"f8aa26af-7a43-48e4-8967-fc9c68b677e7","resolution":{"observed_at":"2026-07-31T02:45:28.740437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.742918Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.742918Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:67c21492bd71318bc346901ed88c3bedff343c280fa41d88211095a48653cc28","observation_id":"dc8115cf-ab02-46f3-b588-6613b10fec7b","resolution":{"observed_at":"2026-07-31T02:45:28.742918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.745498Z","title":"Your task:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.745498Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:65894e0ee026cc1280ea264a7c54b4516d5eaa70e640e10c854a27601ef81dcb","observation_id":"01934e87-6841-4b7e-b782-b5d8748c1a3f","resolution":{"observed_at":"2026-07-31T02:45:28.745498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.748223Z","title":"If the tools did not provide helpful information and the answer was effectively derived from tool-free reasoning, especially in the last step, discard the trajectory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.748223Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:d1dc79ac00e629250fbe375331154b9b4dbd8667483872055b5ff867dfc8c98e","observation_id":"721699a6-5bbe-4c31-be63-af49893c64fe","resolution":{"observed_at":"2026-07-31T02:45:28.748223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.751038Z","title":"Remove the unhelpful repeated tool-call steps and keep only the step that produced the key useful information","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.751038Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:fb436958ce1ac7f3e967b129a4e33fe98efced5a531fad499b2b6e52b22f7b21","observation_id":"6481be4f-4d3b-44bd-929a-4bdf040447c7","resolution":{"observed_at":"2026-07-31T02:45:28.751038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.753539Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.753539Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:323431f36d9585389fef5566da2b85fc2a24f273953043f16b22255a9d636605","observation_id":"8e132085-1fd6-4639-9a8d-f4b0555c011c","resolution":{"observed_at":"2026-07-31T02:45:28.753539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.756021Z","title":"<tool_call>result = 1result</tool_call>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.756021Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:387c60214a85453ea8232b778612e9789cafa4027ed502975d35774e69481d74","observation_id":"594813a7-0842-4cd8-a4c2-804ec02113fe","resolution":{"observed_at":"2026-07-31T02:45:28.756021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.758925Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.758925Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:3a151741b2ca53fca85276282cf457d955c10d114a36bb49e48b087c479b5758","observation_id":"2ada38ae-0135-49b7-af68-e6eb62708cb7","resolution":{"observed_at":"2026-07-31T02:45:28.758925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.761488Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.761488Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:94c0bf15de5506cb116c027f4fbe3baed323b40445e178ee60904029cd071f58","observation_id":"23ff0178-155a-4c30-ab85-16d9eba831f2","resolution":{"observed_at":"2026-07-31T02:45:28.761488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.764216Z","title":"If not, try to refine the <observation> to make it more accurate and specific to the actual tool response","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.764216Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:9d50360c917a29d046c4036cf42363055ceb14daa0aea36bb1ce6f5820b235f3","observation_id":"5701dac1-004c-480d-a7bd-253319c6baa1","resolution":{"observed_at":"2026-07-31T02:45:28.764216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.766799Z","title":"decision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.766799Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:5b901a1092d0db6278ce5598bebcfb74837ae4b19b1e43c6e1d88c0429c132a0","observation_id":"ba34f0f3-8a81-4021-b255-30062c044d0d","resolution":{"observed_at":"2026-07-31T02:45:28.766799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.769462Z","title":"decision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.769462Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:692ef9b4193ed3b41b6f72b3d098a94a3c64052ddf68fe9d1ac67fd49dbff069","observation_id":"4064dee0-ee66-47ed-b795-6d7fc8a69e53","resolution":{"observed_at":"2026-07-31T02:45:28.769462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.772299Z","title":"decision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.772299Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:5ae5a733474ee506d62a208540dea7f17c2a4c708f8e328979ae6199d81cb17b","observation_id":"11db76c3-a617-49ac-819a-608158d109c7","resolution":{"observed_at":"2026-07-31T02:45:28.772299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.774898Z","title":"messages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.774898Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:99a2148ee07a348826db0292be80936d6b7714dffab2118a8285d60e22656a3c","observation_id":"387665f0-ab5a-42e6-a3ab-fe82aba7959b","resolution":{"observed_at":"2026-07-31T02:45:28.774898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.777672Z","title":"kind\":\"original_message","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.777672Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:6855d73aadd27140213b79d96eaf449934a1261fec7c2ca3f7ff730ad37b86a3","observation_id":"16458e43-b5c6-429a-a411-35af7f8ba609","resolution":{"observed_at":"2026-07-31T02:45:28.777672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.780502Z","title":"If a tool- response step is kept, keep its <tool_response> in the corresponding original_message instead of rewriting it","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.780502Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:063cad8acbce5a241c994425c7983e0937b5c5efbf1ebf00a5bd1b6bc2065409","observation_id":"b5dcd42d-12af-4582-a4db-31ec8f260ed6","resolution":{"observed_at":"2026-07-31T02:45:28.780502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.783235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.783235Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:2f2fcf0a3513a152f7fa17fb9b2248cd0efcbfcf837903305aeddcd6a9fc7996","observation_id":"4e132a52-4ee8-45e3-8585-fb058a72411e","resolution":{"observed_at":"2026-07-31T02:45:28.783235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.785718Z","title":"You should decide whether to use code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.785718Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:5d2a48814298a0b94dced1a821950beb098fa028d3a88b886a2b741a9400f46d","observation_id":"1c756479-ba4d-4509-a6e2-f77f415d3881","resolution":{"observed_at":"2026-07-31T02:45:28.785718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.788386Z","title":"Only write codes when necessary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.788386Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:a1ae0beaaeeea3d38a8aed5f2ae439a7f5dc7457ea5da9c246d764185922a40b","observation_id":"240dd7ca-3c59-4002-a424-8e8e5317b7e9","resolution":{"observed_at":"2026-07-31T02:45:28.788386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.790836Z","title":"hint\"field as the training hint. The remaining fields,","venue":null,"work_id":null,"year":2097},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.790836Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:d84b043e997c27adb268c5063b0e5d1b118ff4de5ebbee379bec998114296877","observation_id":"97dd0d38-a0d2-4bd4-98a0-77ee01622d77","resolution":{"observed_at":"2026-07-31T02:45:28.790836Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.793791Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.793791Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:b44840f4117e813d3e8f68410652f0ab446d54086fc6a15a4a4bb5a40aa7d871","observation_id":"4886ad11-f260-487d-b221-8e0ac8861091","resolution":{"observed_at":"2026-07-31T02:45:28.793791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.796309Z","title":"q0\") ... <tool call> from PIL import ImageDraw annotated = get image(","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.796309Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:40b0cc04d7c95dc4d7f93fabb18bc0b54e55d0ffd30a0930f0997b381e023239","observation_id":"715a1468-ea82-4820-abb6-38653cf7895b","resolution":{"observed_at":"2026-07-31T02:45:28.796309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.798852Z","title":"Original image refs: q0 Generated image refs: g0 </tool response> <observation> The resized image clearly shows the text \"CVPR\" in the center of the spiral pattern","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.798852Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:0ab6890d9d79b1a9d876f0228908092e0b8bdc18b951379bd946697919090fc9","observation_id":"0afa8493-ba4e-40b2-b8a4-7a72e6ce0d4a","resolution":{"observed_at":"2026-07-31T02:45:28.798852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.801757Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.801757Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:f29954d10f1be38a4b8bfb5742449ec1bb782f4be885b36e99ee266733faab5f","observation_id":"27baaa7b-5ede-46d3-93f1-6d18a5738f01","resolution":{"observed_at":"2026-07-31T02:45:28.801757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.804274Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.804274Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:9e53a76c0b2b1e7dc34411170173b1e02e6d68e4d688dad9b296927cf354657b","observation_id":"a1b47cb7-aeff-4312-8b3a-4fa4ddbf2325","resolution":{"observed_at":"2026-07-31T02:45:28.804274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:45:28.806859Z","title":"What appears in the field with the question mark if we do the same with the number 5?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.806859Z"},"links":{"citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:1b282baf12cfc62dd1fd0ff5da05053333ded4d67c63eeeb0fa944d9ab7f1474","observation_id":"2c5fcaf0-3772-4c99-9512-25faf8bf9fab","resolution":{"observed_at":"2026-07-31T02:45:28.806859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2607.28595."}