{"as_of":"2026-08-10T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a4169d7f4e91eeec6daa6ecfc7026c4cdf508b6e1c20adb7f0b9dfd7870af10","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:21:37.751127Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02217/citation-record","integrity":"/paper/2608.02217/integrity","json":"/paper/2608.02217/citation-record.json","paper":"/paper/2608.02217"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:30.585410Z","title":"frontal lobe","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:30.585410Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:976e78d3184e532971a4958cfeba2bf4bd1cc0658e4e1143c63dfe66de6db388","observation_id":"8faa88f4-15f3-4499-b9e0-20fc7242b5de","resolution":{"observed_at":"2026-08-04T11:21:30.585410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-09T07:27:23.473299Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-08-04T11:21:30.691752Z","title":"arXiv preprint arXiv:2506.23918 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:30.691752Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:7befb5c6cd3ce2889ed5e7d44993c7cbae0c884e362a79e08beac6b51fd2bc0c","observation_id":"0bea3020-ad66-4744-aa3d-4e3758856636","resolution":{"observed_at":"2026-08-04T11:21:30.691752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12538","snapshot_observed_at":"2026-08-04T11:21:30.797160Z","title":"arXiv preprint arXiv:2601.12538 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:30.797160Z"},"links":{"cited_paper":"/paper/2601.12538","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:80b1e6a3d34212e5592e8add55435f7f8c768eab6ca3550e65096e37bb248901","observation_id":"55881379-5aca-4698-bd96-58c9b832e468","resolution":{"observed_at":"2026-08-04T11:21:30.797160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-04T11:21:31.004277Z","title":"arXiv preprint arXiv:2505.15966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.004277Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:65067623e2512b767281a3831d38ecad19d86ced9b0f60e1ca39f5753cf46da0","observation_id":"df3b4678-7401-46e3-91b6-83f0fe82961f","resolution":{"observed_at":"2026-08-04T11:21:31.004277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-04T11:21:31.166501Z","title":"thinking with images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.166501Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:c9a21fc0baf59a9081ed175d9e6e6dbf0dca9c215d1f750f96a52cc53f9d993e","observation_id":"f816da44-83dc-4692-88b4-b70cc062e96d","resolution":{"observed_at":"2026-08-04T11:21:31.166501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:31.296946Z","title":"arXiv preprint arXiv:2512.17306 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.296946Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:e5d0c284c871f63a7bcdae58b162a14a4974439c35d89e21e364b793ee947e5f","observation_id":"49249fef-42c9-4c8a-b7c9-43c026bdfca5","resolution":{"observed_at":"2026-08-04T11:21:31.296946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-08-04T11:21:31.405672Z","title":"arXiv preprint arXiv:2508.11630 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.405672Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:9070bda3bd4073514c642cf7bb64da8761795adc51136dea0fe7016fa856229c","observation_id":"89455cc3-5085-4285-a570-81fd2fb1678e","resolution":{"observed_at":"2026-08-04T11:21:31.405672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:31.526985Z","title":"arXiv preprint arXiv:2512.02361 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.526985Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:9e3cd91a17ccbbe2b5e6795c4001c4f1d1b04a92402eff2f416bbcc6212e09ee","observation_id":"dd1ef5aa-348c-4636-8300-943e2d937d8e","resolution":{"observed_at":"2026-08-04T11:21:31.526985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-04T11:21:31.692492Z","title":"arXiv preprint arXiv:2511.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.692492Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:069e02b73b59de2b266fb84b43d4d3ca5b196965d89429ece0e9461bdc3b82f5","observation_id":"6cb20006-0d3a-48a5-a4f5-8efc69c24579","resolution":{"observed_at":"2026-08-04T11:21:31.692492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-04T11:21:31.750266Z","title":"arXiv preprint arXiv:2508.05748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.750266Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:5262a9fdc450dee3497164c2837edb43c26702c7a567d34203a7b66d4c4bf100","observation_id":"4f6d35e9-fb6f-426c-a75b-6bbbdf13e80f","resolution":{"observed_at":"2026-08-04T11:21:31.750266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-10T08:37:31.534307Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22525","snapshot_observed_at":"2026-08-04T11:21:31.872842Z","title":"arXiv preprint arXiv:2505.22525 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.872842Z"},"links":{"cited_paper":"/paper/2505.22525","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:eaf670cb41412deb466ec7fcf56f8f4bf27fdbabb10a4b7b7b2b92d115fdd9a3","observation_id":"d510e1af-4502-462d-be41-78f835eee30a","resolution":{"observed_at":"2026-08-04T11:21:31.872842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.099805Z","title":"arXiv preprint arXiv:2507.16746 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.099805Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:edee772a35e70348d8e0bb987ea953084f5b063dc72ee5f7922864f322d27afa","observation_id":"2dadbcd5-be86-4b81-bf0d-e8418d1f040e","resolution":{"observed_at":"2026-08-04T11:21:32.099805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-09T15:59:03.013255Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16918","snapshot_observed_at":"2026-08-04T11:21:32.263785Z","title":"arXiv preprint arXiv:2512.16918 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.263785Z"},"links":{"cited_paper":"/paper/2512.16918","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:8960cf283717b08117b5873a44db0a1c5803fca1c6f2e25ef73031cfcb826d83","observation_id":"4db38c71-e37a-438c-a0e2-12554df5d705","resolution":{"observed_at":"2026-08-04T11:21:32.263785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.429232Z","title":"arXiv preprint arXiv:2601.18631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.429232Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:7b5596a5dadf8be4aa6fa98ab8a78a52aac6b85d384c5c075806976da3f24ab2","observation_id":"206eba51-4c57-416c-95e3-eb2787142537","resolution":{"observed_at":"2026-08-04T11:21:32.429232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.570731Z","title":"arXiv preprint arXiv:2603.15030 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.570731Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:ef0446553dc73d0b1f3b6eb063185741d781312acc796445a09c8acd2c91c901","observation_id":"dbbbd3cf-af88-4e92-80f9-7dbe7e046d10","resolution":{"observed_at":"2026-08-04T11:21:32.570731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.730680Z","title":"arXiv preprint arXiv:2511.01833 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.730680Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:dd8e5c12f5cc47640f82374478c760249dcfb1e923c347ede07ba2591333ba4c","observation_id":"86d17ebd-b77a-42c0-b0d4-4527b18a0376","resolution":{"observed_at":"2026-08-04T11:21:32.730680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:32.869736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:32.869736Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:1c577e83aa91b2b4cd2356cab233500e774b483dafa6afbe485874ad6f1062ef","observation_id":"50c8a02c-957f-4783-a411-b3c289753504","resolution":{"observed_at":"2026-08-04T11:21:32.869736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07998","last_updated":"2025-08-27T07:42:56Z","snapshot_observed_at":"2026-08-07T15:21:56.692035Z","submitted_at":"2025-07-10T17:59:55Z","title":"PyVision: Agentic Vision with Dynamic Tooling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07998","snapshot_observed_at":"2026-08-04T11:21:33.020557Z","title":"arXiv preprint arXiv:2507.07998 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.020557Z"},"links":{"cited_paper":"/paper/2507.07998","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:343c6415d5b3c38c572ff0559bb2ed341e04d75388b957be2c2aaceb235a5194","observation_id":"c0b2f9e1-cf90-44e3-8f8d-2e6eee964a40","resolution":{"observed_at":"2026-08-04T11:21:33.020557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.138152Z","title":"arXiv preprint arXiv:2512.18745 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.138152Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:cdf37c410f339c2a5c69b58c90eaf3375e9dda86352415c890e8994ec42213a8","observation_id":"02aec7dc-2af6-4895-8104-92a6ef964c20","resolution":{"observed_at":"2026-08-04T11:21:33.138152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.307247Z","title":"Farrar, Straus and Giroux , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.307247Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:db1acbf22962068e522eaab1a6d7e70cd9b10c0fe11ef35eee7e0b7829469636","observation_id":"c38a7f60-cf50-4fa5-a15c-c501dea87978","resolution":{"observed_at":"2026-08-04T11:21:33.307247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.419905Z","title":"arXiv preprint arXiv:2507.05255 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.419905Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:8d28c342d1a38c975ab74c2fda3b7b4a670c6e266f09f1ddb4e16d18cb00dac8","observation_id":"3957ee38-fd3a-48a9-8f9d-f4a4f3e3cabe","resolution":{"observed_at":"2026-08-04T11:21:33.419905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.524745Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.524745Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:9d7046410205418502f7811a12424056162db5e01b02a6941b4ecb2166d53986","observation_id":"2915f643-f191-41e9-9ffd-12aaf5e2e5fb","resolution":{"observed_at":"2026-08-04T11:21:33.524745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.693985Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.693985Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:880f831209f7dfd3224a39519ece153c83b798cf490dafe64f85d58e59da0383","observation_id":"88b9b12c-e622-48a1-9057-12979cac378d","resolution":{"observed_at":"2026-08-04T11:21:33.693985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:33.865724Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.865724Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:71677ad1163f68e6ed7f65b90ea72bdd38bf61c824bc8711b0d611f58e43901c","observation_id":"3372be24-9f17-495b-b9ea-541be82e5469","resolution":{"observed_at":"2026-08-04T11:21:33.865724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T11:21:33.970631Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:33.970631Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:b41ffe1b84c5f5624e1c686bd217761495b49c9a5fd96e96b89102a9caee2a33","observation_id":"49918bfa-7d57-4000-9ebc-11ca93b4ea3c","resolution":{"observed_at":"2026-08-04T11:21:33.970631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T11:21:34.081895Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.081895Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:8837490cc14364ec9013d25a02f0994a26ea9ec8d03c98c24263faee79acf19d","observation_id":"5099f534-02a5-43ea-b00c-db6306f19bec","resolution":{"observed_at":"2026-08-04T11:21:34.081895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:34.283399Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.283399Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:8d9f095dbd3ec554804b92adc03deef054b2b7881a7fc06ad7a2759376dc359f","observation_id":"ae365339-1464-4dc8-b191-e42963bd7fbb","resolution":{"observed_at":"2026-08-04T11:21:34.283399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:34.360346Z","title":"arXiv preprint arXiv:2511.15718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.360346Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:920a0e9eb85b0b58645af4c0d82fbcb4d97161ae28cee8c1a72a79a336415846","observation_id":"87b44f03-1257-456f-9665-cbd4ab106994","resolution":{"observed_at":"2026-08-04T11:21:34.360346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-04T11:21:34.526276Z","title":"arXiv preprint arXiv:2504.11536 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.526276Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:727393ad7e14650fea3f273600e4abd633ab8255332009768cd612132fb3979e","observation_id":"d513d2cf-386c-44d1-be56-dc834546aa97","resolution":{"observed_at":"2026-08-04T11:21:34.526276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-04T11:21:34.678773Z","title":"arXiv preprint arXiv:2602.15763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.678773Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:536543cbcd3c5481213215b6bf6556fd527b08c867c0599c994f7dcd800a80ae","observation_id":"40812ba8-8a59-44de-9aab-cf6eb63eaf52","resolution":{"observed_at":"2026-08-04T11:21:34.678773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:34.815993Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.815993Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:95ee15e4961d15c3df12d7b3782e3ee92294fab3086fbf4f72b08d487a336612","observation_id":"2fbf0488-6a8b-4433-9c8d-8ce6e7e35811","resolution":{"observed_at":"2026-08-04T11:21:34.815993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-04T11:21:34.913476Z","title":"arXiv preprint arXiv:2210.03629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:34.913476Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:afe502cd5207f6db17e13a37939a0de2baf1c400822e4d04a308e0ae6f0b6aec","observation_id":"b91c9aad-5e4f-4d65-94de-ec0c843f35f5","resolution":{"observed_at":"2026-08-04T11:21:34.913476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T11:21:35.051933Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.051933Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:08cd35acb1d9c72bc5bdf991c2e62bbc86da11b3c69073fc38a48e9ed658f284","observation_id":"d0e61e84-7720-4e04-a005-4d514bccc29e","resolution":{"observed_at":"2026-08-04T11:21:35.051933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-04T11:21:35.222978Z","title":"arXiv preprint arXiv:2509.23661 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.222978Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:75a9189baa9f53c17e90daaa29d682683a12ea25b82c2e3850cf2e04eaa5dff7","observation_id":"d6a70588-d786-4d26-a807-748139f3f9aa","resolution":{"observed_at":"2026-08-04T11:21:35.222978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T11:21:35.368683Z","title":"arXiv preprint arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.368683Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:81df3def709751dc8f99afd5aa315e94c489c5aa69d6a1832d7d5d97c4fcaf8e","observation_id":"dc1c3032-65e1-4bf6-9ac9-0d0528e9c944","resolution":{"observed_at":"2026-08-04T11:21:35.368683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T11:21:35.500219Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.500219Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:265fd2e90e3b866ccc63add7275d4750c60ba873b9f7ee7a6969612c41f3ef65","observation_id":"c86a27b2-8213-4801-a597-4329d0ac8750","resolution":{"observed_at":"2026-08-04T11:21:35.500219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:35.631519Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.631519Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:50bc22ec7bb9b909d055f17ca8eb2590b399f2f7127136905a59dc7c22241076","observation_id":"fa50ca38-c798-4265-bfb8-a211dd6f7b6c","resolution":{"observed_at":"2026-08-04T11:21:35.631519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:35.765804Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.765804Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:1b0ca6f7b1e445639ea6125f6a68de26b2cff0654112bbddd625c038fed292d4","observation_id":"1a1e14f3-6f6e-46f4-8f4a-8a08cc0a7a15","resolution":{"observed_at":"2026-08-04T11:21:35.765804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:35.936455Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:35.936455Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:36c7d7b8063bff2547af0d52f3681383c325d04d8992b7dba462c56474c671fe","observation_id":"c01bcf76-1d62-497c-9306-353e3717f03d","resolution":{"observed_at":"2026-08-04T11:21:35.936455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.110916Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.110916Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:8ed1513d87293bf4aecd89a02f84258379224b07839fb5471599d93fc8eb8f2a","observation_id":"315183c9-b652-4464-bbce-4d4eb4acdf37","resolution":{"observed_at":"2026-08-04T11:21:36.110916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.214560Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.214560Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:b66ca2f9a3714ea932b04c2efdfa43487f2341b525d01da98f677d3c52a9bf98","observation_id":"dd8bc600-a797-42a8-a0f9-6fcb1c39a552","resolution":{"observed_at":"2026-08-04T11:21:36.214560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.359173Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.359173Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:dce50ad8e526d332c07b7f5eabf0667663373b1300f5e0544a29f873243f6d53","observation_id":"ee49c02d-c949-4d28-9a0b-edd91c11fff7","resolution":{"observed_at":"2026-08-04T11:21:36.359173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.478619Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.478619Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:3da331761ab4d3dc15ab7df6664150a045c7a417abe09f6c9a75806bd8e30193","observation_id":"946866a5-b25d-45ec-8549-25bfb2e1befd","resolution":{"observed_at":"2026-08-04T11:21:36.478619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:36.631982Z","title":"arXiv preprint arXiv:2512.17312 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.631982Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:73e2743f0dd64543a5fc9ebd03d6f90cbc71b139f0acb2408f558a0b6c91dc60","observation_id":"420aea74-593e-41d7-bf4e-a5afd1214906","resolution":{"observed_at":"2026-08-04T11:21:36.631982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.13606","last_updated":"2026-04-29T05:49:25Z","snapshot_observed_at":"2026-07-06T22:42:12.887517Z","submitted_at":"2026-01-20T05:11:44Z","title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.13606","snapshot_observed_at":"2026-08-04T11:21:36.797757Z","title":"arXiv preprint arXiv:2601.13606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.797757Z"},"links":{"cited_paper":"/paper/2601.13606","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:d6c035e83917ba3a17c9dbf38fd5b0d210c32f37c33f9b15f94fee9031ab062b","observation_id":"5f43583c-36f5-46cf-b760-beeb723e8b31","resolution":{"observed_at":"2026-08-04T11:21:36.797757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-04T11:21:36.905665Z","title":"arXiv preprint arXiv:2509.07969 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:36.905665Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:256566be9b0e43292418aa8be1e912c2d09790132b8e65091cac2d754e64e19b","observation_id":"406b1b09-af6c-4c3f-a08f-ce247c32f70b","resolution":{"observed_at":"2026-08-04T11:21:36.905665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T11:21:37.036845Z","title":"arXiv preprint arXiv:2504.10479 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.036845Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:35f7e6a9df1bafcec56a248cb4718b8dfb06377da49d98929160ed050c09175a","observation_id":"259f18f9-4c8f-4576-946c-8d20b5e8453c","resolution":{"observed_at":"2026-08-04T11:21:37.036845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T11:21:37.188863Z","title":"arXiv preprint arXiv:1711.05101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.188863Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:d224ed74a464b86e9ac29684a641bb8af742f3a83d6182f729cdb16e67c7419c","observation_id":"cf64502c-aa57-495c-8bee-8c3a36aee59d","resolution":{"observed_at":"2026-08-04T11:21:37.188863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:37.299278Z","title":"arXiv preprint arXiv:2602.16742 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.299278Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:92d1f637d939a82f798b04d32d729a6d69ab1caffa6e65341b9122cbf91fcc5a","observation_id":"b6c457f4-93f2-45b4-a887-acde4635f9d6","resolution":{"observed_at":"2026-08-04T11:21:37.299278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:37.451142Z","title":"arXiv preprint arXiv:2511.21395 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.451142Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:a5bd4d3204fdcde146f443db206427bb9609504bb60bfa494e205449c0d50141","observation_id":"8bed2fc4-6ddb-4e71-8487-d536773e9f46","resolution":{"observed_at":"2026-08-04T11:21:37.451142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:21:37.572703Z","title":"arXiv preprint arXiv:2511.19773 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.572703Z"},"links":{"citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:44cfd74b0ff3902008abd6d7b224c98ff1915b96d4fb2cf1a95cdbf0621b0677","observation_id":"37c1e6f3-32bd-43de-b202-1f24091eefa9","resolution":{"observed_at":"2026-08-04T11:21:37.572703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-04T11:21:37.751127Z","title":"arXiv preprint arXiv:2508.02324 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:37.751127Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:35d67f0791d8b067cb2ead4c9ac00bf5cee482b43a6ccca491039d2120154b1a","observation_id":"2e3181e7-1cbd-441d-b30b-5b9ceea9a1d4","resolution":{"observed_at":"2026-08-04T11:21:37.751127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T07:40:29.974097Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.02217."}