{"as_of":"2026-08-10T14:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:107ee571d22ab35dd6a7e23f047819c934bd6298dc6c2e2fe517e60f65efa168","coverage":[{"denominator":124,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:27:50.356815Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:17:11.770737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:56:55.498403Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":"2506.07976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-02T11:56:55.498403Z","title":"Thinking vs","venue":null,"work_id":"1619f6ef-5a19-4b4e-9731-fef04ca5be72","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":175,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:e548f5975b4ccef5208dd0f4e844524d93f63b3ed28ac29c1dbbf0508b442055","observation_id":"254e48c4-098f-4121-97f6-fc85d6ece7e4","resolution":{"observed_at":"2026-05-22T21:42:10.825837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-08-05T20:17:11.770737Z","title":"Thinking vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.770737Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:241df56f6bef031244b305126ae9bc5d84076c9ccfdb39f9b364c6e033dc79e2","observation_id":"78856db5-fe51-411c-96bf-e5a93e222d04","resolution":{"observed_at":"2026-08-05T20:17:11.770737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":"2506.07976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-02T11:56:55.498403Z","title":"Thinking vs","venue":null,"work_id":"1619f6ef-5a19-4b4e-9731-fef04ca5be72","year":2025},"citing_paper":{"arxiv_id":"2509.07553","last_updated":"2026-04-03T02:36:28Z","snapshot_observed_at":"2026-07-06T22:26:22.911328Z","submitted_at":"2025-09-09T09:46:01Z","title":"VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T18:06:12.349285Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2509.07553"},"observation_digest":"sha256:f4f303235d23f1b162ed2dfac12fc5bfb830eadb0cc9fa2177e3a919999e2080","observation_id":"1cf96ff8-46c8-4bb8-baa2-5b44b270689c","resolution":{"observed_at":"2026-05-18T18:06:42.761774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":"2506.07976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-02T11:56:55.498403Z","title":"Thinking vs","venue":null,"work_id":"1619f6ef-5a19-4b4e-9731-fef04ca5be72","year":2025},"citing_paper":{"arxiv_id":"2512.07461","last_updated":"2026-05-14T12:43:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T11:39:43Z","title":"Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T01:11:26.411893Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2512.07461"},"observation_digest":"sha256:034acba64d5b1529af5819333a11f0af1e815d742a53955d5314aeff67bd9083","observation_id":"946e1a85-769b-4a5d-8d47-a77f080b9904","resolution":{"observed_at":"2026-05-17T01:13:47.987463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":"2506.07976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-02T11:56:55.498403Z","title":"Thinking vs","venue":null,"work_id":"1619f6ef-5a19-4b4e-9731-fef04ca5be72","year":2025},"citing_paper":{"arxiv_id":"2605.02572","last_updated":"2026-05-04T13:25:05Z","snapshot_observed_at":"2026-07-06T23:15:37.099197Z","submitted_at":"2026-05-04T13:25:05Z","title":"On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-08T18:13:25.735085Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2605.02572"},"observation_digest":"sha256:6c13164e893e694df4186326faaf687e590c4ec944e7e7d1edb0651cfe5a2631","observation_id":"b221f6b0-b3c2-4192-9046-202a2fbf1df0","resolution":{"observed_at":"2026-05-09T06:40:40.874836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":"2506.07976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-02T11:56:55.498403Z","title":"Thinking vs","venue":null,"work_id":"1619f6ef-5a19-4b4e-9731-fef04ca5be72","year":2025},"citing_paper":{"arxiv_id":"2605.29119","last_updated":"2026-05-27T21:28:26Z","snapshot_observed_at":"2026-08-07T11:23:54.936149Z","submitted_at":"2026-05-27T21:28:26Z","title":"PRO-CUA: Process-Reward Optimization for Computer Use Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T11:46:38.569528Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2605.29119"},"observation_digest":"sha256:88c04fe539b4ab88c6559fdbb40c1a1f5395664dc46dbeb14ddf5e5b3e0b8bec","observation_id":"bae768d1-b8db-4710-b31f-14a59cad3690","resolution":{"observed_at":"2026-06-29T11:53:24.210583Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":"2506.07976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-02T11:56:55.498403Z","title":"Thinking vs","venue":null,"work_id":"1619f6ef-5a19-4b4e-9731-fef04ca5be72","year":2025},"citing_paper":{"arxiv_id":"2606.05597","last_updated":"2026-08-07T17:58:32Z","snapshot_observed_at":"2026-08-10T14:11:34.044234Z","submitted_at":"2026-06-04T02:18:44Z","title":"AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T02:45:25.694378Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2606.05597"},"observation_digest":"sha256:127a6ebe86b56d81f039546a6074eb635c31b8d7df88f148a5644564d5445ddf","observation_id":"2b97dea4-7a53-4863-84ca-2707b6338858","resolution":{"observed_at":"2026-07-02T11:56:55.499801Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Thinking vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-07-11T07:57:39.948830Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:f443820cccf032db9cf488c82cd5682c9023821fe89a82ee86766add5e6f9c2a","observation_id":"29cf167a-bdf0-43fa-ae28-3af81c202ecb","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07976/citation-record","integrity":"/paper/2506.07976/integrity","json":"/paper/2506.07976/citation-record.json","paper":"/paper/2506.07976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.868438Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.868438Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:e2288df0be8a919c3136314ca049b9e147b2610ebe19314aaa3fc96a02bfaf14","observation_id":"c63f7383-6871-4a1f-9e9f-a6ca34e0960a","resolution":{"observed_at":"2026-08-07T05:27:49.868438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.878800Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.878800Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:09021df9d448c19d093f6501d371005d16b76880bff249403d43574acdcb3c9b","observation_id":"09ad165f-ce4f-4875-a54d-190c4ef15920","resolution":{"observed_at":"2026-08-07T05:27:49.878800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.883427Z","title":"Introducing computer use, a new claude 3.5 sonnet, and claude 3.5 haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.883427Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:1d843191d043e61bb686f2db3a405f678e692371c20566bafd7df78280001293","observation_id":"b7e934bc-4905-4d1a-bff2-1ce860e60c16","resolution":{"observed_at":"2026-08-07T05:27:49.883427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.887573Z","title":"Introducing operator, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.887573Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:4f58b05b6323d53e0a5c844aa94f735f362a54c796f2944f4914655c3a19c675","observation_id":"2b960abc-246f-4b64-8ca4-22f1d4193945","resolution":{"observed_at":"2026-08-07T05:27:49.887573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.892125Z","title":"Browser use: Enable ai to control your browser, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.892125Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:ad199e35e16c95897ea6231969454bfceee472518fd6b5378a8b7df299fe3d68","observation_id":"2cb1e39a-110e-4f02-ac44-7521796337d1","resolution":{"observed_at":"2026-08-07T05:27:49.892125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.896875Z","title":"Cogagent: A visual language model for gui agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.896875Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:509bee2426da0e21cc809907b2aae7e453496cdbae54b1372b6d9ac1b158938a","observation_id":"708cb064-5c0e-47b6-a6ba-913ce2ae3efb","resolution":{"observed_at":"2026-08-07T05:27:49.896875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.901258Z","title":"Your code’s new collaborator, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.901258Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:62bfe73c314f1db99fe8d22902da3b819ea579c42db578ba3eb3b787c6e2ffc8","observation_id":"695a43d4-9e00-495d-b373-8ec44cebb11b","resolution":{"observed_at":"2026-08-07T05:27:49.901258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.906388Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.906388Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:276bec750079d1b6f0e3281d370880a5925635cb356f4d15b11ec37563b6877e","observation_id":"3845aa36-fb6e-4bd0-93e2-223a6e589eda","resolution":{"observed_at":"2026-08-07T05:27:49.906388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-07T05:27:49.911434Z","title":"Fine-tuning large vision-language models as decision- making agents via reinforcement learning.ArXiv, abs/2405.10292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.911434Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:286785a8b8395ba26a912e9edd0fdc1c0d1117e5799535a71f4414a4bac1b57d","observation_id":"53650ddf-b229-4629-83b1-d4d6810ccd85","resolution":{"observed_at":"2026-08-07T05:27:49.911434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07752","last_updated":"2021-09-30T23:04:25Z","snapshot_observed_at":"2026-08-10T06:38:17.848902Z","submitted_at":"2020-01-21T19:37:33Z","title":"Emergence of Pragmatics from Referential Game between Theory of Mind Agents","version":2},"cited_work":{"arxiv_id":"2001.07752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.07752","snapshot_observed_at":"2026-08-07T05:27:51.682671Z","title":"Emergence of Pragmatics from Referential Game between Theory of Mind Agents","venue":"cs.AI","work_id":"bd9ef49d-b676-455b-832d-3e129c968ccf","year":2020},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.916142Z"},"links":{"cited_paper":"/paper/2001.07752","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:6bf5efecd5206e1085b81d31ed08be62d183f18cc8f191357c4357d377efadb2","observation_id":"ea17f895-9845-4de0-9566-7df6100d870f","resolution":{"observed_at":"2026-08-07T05:27:51.687826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.920980Z","title":"Iterative teacher-aware learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.920980Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:be99963d319bad2c37df976397cba68ca1a235c2b9160b69e40a91f90806d0c4","observation_id":"ed5a7012-8a04-4d51-a993-5f10dc643ac1","resolution":{"observed_at":"2026-08-07T05:27:49.920980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16295","last_updated":"2025-01-27T18:35:05Z","snapshot_observed_at":"2026-08-10T13:32:23.628028Z","submitted_at":"2025-01-27T18:35:05Z","title":"Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity","version":1},"cited_work":{"arxiv_id":"2501.16295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16295","snapshot_observed_at":"2026-08-07T05:27:51.662445Z","title":"Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity","venue":"cs.LG","work_id":"08573191-4761-40c1-9837-50945b695104","year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.926091Z"},"links":{"cited_paper":"/paper/2501.16295","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:b682ece6ae16126226f50850819ea3743a8b0e6a1cac6ae709b9f39cab335898","observation_id":"f13cb217-ff8e-47c5-a4bf-d67e8501f29f","resolution":{"observed_at":"2026-08-07T05:27:51.667553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-07T05:27:49.931593Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.ArXiv, abs/2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.931593Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:81a950358bd2a4eb172995b7beedd90fdb76d25a722d7920c7863a59a9ca56f9","observation_id":"16608187-a392-4131-8883-d20194c97ac9","resolution":{"observed_at":"2026-08-07T05:27:49.931593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15004","last_updated":"2024-12-05T02:00:07Z","snapshot_observed_at":"2026-08-05T16:22:08.749834Z","submitted_at":"2024-11-22T15:26:23Z","title":"ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15004","snapshot_observed_at":"2026-08-07T05:27:49.936632Z","title":"Scribeagent: Towards specialized web agents using production-scale workflow data.ArXiv, abs/2411.15004, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.936632Z"},"links":{"cited_paper":"/paper/2411.15004","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:b28638b094b9f6c57497870fd15c7d4b2429775d7db7a275a2647e9226517121","observation_id":"50ff3fcd-35ba-4d17-90e2-c390eab1f002","resolution":{"observed_at":"2026-08-07T05:27:49.936632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.941398Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.941398Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:02111736e80579148800a13c6b37403e55022b3a36cfc53e300da8af42974f4d","observation_id":"1729e8e2-2550-4430-b0d3-2403302b1346","resolution":{"observed_at":"2026-08-07T05:27:49.941398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.945786Z","title":"Dery, Corey Staten, Mikhail Khodak, Graham Neubig, and Ameet Talwalkar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.945786Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:3e0ca3c20794a2f11443c6fa6ef6dcbf1992bf185cf4f0b119d29a4566c37cfb","observation_id":"aba8c202-d633-4d52-b917-2d5fb310d650","resolution":{"observed_at":"2026-08-07T05:27:49.945786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.950181Z","title":"Tag-llm: Repurposing general-purpose llms for specialized domains, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.950181Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:7f0d931bb52b769d5c676c4a491a41e10053ac5630041468db2c86401ad3577c","observation_id":"39a910c5-f1bb-4445-b180-046e47fffb87","resolution":{"observed_at":"2026-08-07T05:27:49.950181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07942","last_updated":"2025-03-06T19:40:57Z","snapshot_observed_at":"2026-08-09T01:07:45.625365Z","submitted_at":"2025-02-11T20:41:49Z","title":"Symbiotic Cooperation for Web Agents: Harnessing Complementary Strengths of Large and Small LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07942","snapshot_observed_at":"2026-08-07T05:27:49.954653Z","title":"Agudelo, Peter Qian, and Tianlong Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.954653Z"},"links":{"cited_paper":"/paper/2502.07942","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:963b2077b136497054b4a030691504fd576d1435961c96e9de153178c19b4040","observation_id":"4e4c3a1a-8f5e-4dab-8277-e5e7ef31774a","resolution":{"observed_at":"2026-08-07T05:27:49.954653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13194","last_updated":"2024-12-17T18:59:50Z","snapshot_observed_at":"2026-08-03T11:34:22.888935Z","submitted_at":"2024-12-17T18:59:50Z","title":"Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13194","snapshot_observed_at":"2026-08-07T05:27:49.959454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.959454Z"},"links":{"cited_paper":"/paper/2412.13194","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:98a2a2398b8928ebd65f01bad15404e18ead874d259dd5552d7500f64e9226b1","observation_id":"70ce8759-e329-4903-ba95-328e5c1928d3","resolution":{"observed_at":"2026-08-07T05:27:49.959454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11896","last_updated":"2024-06-14T17:49:55Z","snapshot_observed_at":"2026-08-09T00:37:01.766934Z","submitted_at":"2024-06-14T17:49:55Z","title":"DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11896","snapshot_observed_at":"2026-08-07T05:27:49.964683Z","title":"Di- girl: Training in-the-wild device-control agents with autonomous reinforcement learning.ArXiv, abs/2406.11896, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.964683Z"},"links":{"cited_paper":"/paper/2406.11896","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:e4a62cf6e7ad182f4da11a4bb1dfff890c041036ee604d7617e183cb18ea4242","observation_id":"c4d4bed2-1749-4bfe-ac01-17c9343ec65b","resolution":{"observed_at":"2026-08-07T05:27:49.964683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15760","last_updated":"2025-02-13T18:55:14Z","snapshot_observed_at":"2026-08-10T11:51:41.744726Z","submitted_at":"2025-02-13T18:55:14Z","title":"Digi-Q: Learning Q-Value Functions for Training Device-Control Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15760","snapshot_observed_at":"2026-08-07T05:27:49.969110Z","title":"Li, Sergey Levine, and Aviral Kumar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.969110Z"},"links":{"cited_paper":"/paper/2502.15760","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:cac9be25b86b696f94c042c7b62829f923e7bf2ae2bc4b05f987bc816df05228","observation_id":"70197658-5e2a-4f7a-9cbd-a67f16006c06","resolution":{"observed_at":"2026-08-07T05:27:49.969110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.973768Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.973768Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:5aae76aa64dabdbb85935626cfc8fb3780f60dee7251f0d2458b9c4edfdc7ab1","observation_id":"a5ef3580-6878-45eb-a35f-ac20acc09bae","resolution":{"observed_at":"2026-08-07T05:27:49.973768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-10T13:28:25.177091Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T05:27:49.978039Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.978039Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:c3a6c0c88f83562c24a5e24184846d03503c26d4e96ce6cd368c5c4cea5efc4b","observation_id":"2e782046-7782-462f-9b1e-06e866525791","resolution":{"observed_at":"2026-08-07T05:27:49.978039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.982960Z","title":"Claude takes research to new places, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.982960Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:c46e79c94edef772d73503d39c809b3e19898296b77dde569ca9904f8b7b6883","observation_id":"33019fc2-cecc-4746-977a-048adb9447fe","resolution":{"observed_at":"2026-08-07T05:27:49.982960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.987539Z","title":"Introducing deep research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.987539Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:4adf93ed1fb79f9b65c8faedc6af43c8c257326dcc3e6fde906ee2cc4aa441f3","observation_id":"7220bd2f-52ce-4fb8-8113-eee5b8cc2c5c","resolution":{"observed_at":"2026-08-07T05:27:49.987539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:49.992631Z","title":"Gemini deep research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.992631Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:6f44d2b8ee0f68292c041c05c8f7f369e7208c131fac86156a72cb4aa20808df","observation_id":"29b7f33b-8613-4bcc-b7c5-3272ab79e734","resolution":{"observed_at":"2026-08-07T05:27:49.992631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:27:49.997734Z","title":"Zettlemoyer, Percy Liang, Emmanuel J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.997734Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:faea1849f088c2bb68a12929812e6072d18819064157bb7ca968438c5d5b002e","observation_id":"d1c6c100-0c31-4f6e-bfb5-bca2489afee1","resolution":{"observed_at":"2026-08-07T05:27:49.997734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.003014Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for LLM problem-solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.003014Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:45639150ad33ea82be8cd51f5603b799ccfd2f03163207b999bfc7013e702631","observation_id":"2ad2dafa-1b85-43e4-a524-8efb16084ca3","resolution":{"observed_at":"2026-08-07T05:27:50.003014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.008187Z","title":"Inference-aware fine- tuning for best-of-n sampling in large language models.ArXiv, abs/2412.15287, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.008187Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:688a594addec823fa5fed75d5601e172583f436e3ef66f53715a2b737f6699d9","observation_id":"258a1186-09a0-490a-92f7-cce3cec100c2","resolution":{"observed_at":"2026-08-07T05:27:50.008187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.013716Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.013716Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:4fb72ae729d483613672339bc850406e9a2241ac778efaf03c7403a6bc9251a6","observation_id":"7d2fabcf-f09e-47ba-911f-3879eb3b7a72","resolution":{"observed_at":"2026-08-07T05:27:50.013716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.018456Z","title":"Webglm: Towards an efficient web-enhanced question answering system with human preferences, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.018456Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:dd06a9576a8ec9b6cfbc5b7e84d21d7a5cd01a797dd351bc383f92ff302da479","observation_id":"5c762179-83b1-41c5-af07-945c628de556","resolution":{"observed_at":"2026-08-07T05:27:50.018456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.022921Z","title":"Multimodal web navigation with instruction-finetuned foundation models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.022921Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:de5ff59e78aa9dc885b75f28596c099d4492e4d75127ddc68f4a0811f7eb941c","observation_id":"09ef7536-7bf3-44c5-9e0d-e20627c4c691","resolution":{"observed_at":"2026-08-07T05:27:50.022921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13825","last_updated":"2025-05-24T03:55:22Z","snapshot_observed_at":"2026-08-04T16:18:16.404587Z","submitted_at":"2024-10-17T17:50:38Z","title":"AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13825","snapshot_observed_at":"2026-08-07T05:27:50.033332Z","title":"Agentoccam: A simple yet strong baseline for llm-based web agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.033332Z"},"links":{"cited_paper":"/paper/2410.13825","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:0a88a736b264e21067431ef4113d56254004cb019a9cc157f731124c388dcca8","observation_id":"f84bef39-2991-40df-b917-33be9f082d02","resolution":{"observed_at":"2026-08-07T05:27:50.033332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11854","last_updated":"2024-02-25T16:21:00Z","snapshot_observed_at":"2026-07-06T15:29:50.743434Z","submitted_at":"2023-05-19T17:44:34Z","title":"Multimodal Web Navigation with Instruction-Finetuned Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11854","snapshot_observed_at":"2026-08-07T05:27:50.027736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.027736Z"},"links":{"cited_paper":"/paper/2305.11854","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:35fc1ec15224a97ed5f3188e7e85f71e07731a92c997b7c690d32d6aa7b52fda","observation_id":"4693a926-9a90-412a-855c-ac7ae680c583","resolution":{"observed_at":"2026-08-07T05:27:50.027736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.042472Z","title":"UPS: Efficiently building foundation models for PDE solving via cross-modal adaptation.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.042472Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:322a2c0d13b07bdf69e5d7fc69afb85d982c993c58845f76ea3415d467f905ed","observation_id":"d8e73f28-b6c8-4382-92c3-ba05488d486c","resolution":{"observed_at":"2026-08-07T05:27:50.042472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15978","last_updated":"2024-08-28T17:49:29Z","snapshot_observed_at":"2026-08-06T06:30:12.135984Z","submitted_at":"2024-08-28T17:49:29Z","title":"WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15978","snapshot_observed_at":"2026-08-07T05:27:50.038026Z","title":"Webpilot: A versatile and autonomous multi-agent system for web task execution with strategic exploration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.038026Z"},"links":{"cited_paper":"/paper/2408.15978","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:e4dda1e48d0398bab82961ceee1f767c242b80730943aca84731cd97e8e12499","observation_id":"44ec6c1c-3e1d-450e-ace3-c8a49551fcd0","resolution":{"observed_at":"2026-08-07T05:27:50.038026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09605","last_updated":"2025-03-03T18:59:36Z","snapshot_observed_at":"2026-08-06T04:29:42.591501Z","submitted_at":"2024-12-12T18:59:27Z","title":"AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09605","snapshot_observed_at":"2026-08-07T05:27:50.052967Z","title":"Agenttrek: Agent trajectory synthesis via guiding replay with web tutorials.ArXiv, abs/2412.09605, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.052967Z"},"links":{"cited_paper":"/paper/2412.09605","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:3610c046698a4b436d6a3bf7d0b2d293a097cb955098bf64e05b5ce6c496fef9","observation_id":"dc420f93-efe5-43e7-ae33-b33d2b5899f3","resolution":{"observed_at":"2026-08-07T05:27:50.052967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-07T16:18:02.285718Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-08-07T05:27:50.047548Z","title":"Cat: Content-adaptive image tokenization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.047548Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:f4d2abe91902218d05df65ee9834b5e22a3ee7befa326f11f9e36fbe5e3ee45e","observation_id":"210c2e1d-ef26-42b9-b227-58920dcdad78","resolution":{"observed_at":"2026-08-07T05:27:50.047548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02796","last_updated":"2025-03-21T03:59:29Z","snapshot_observed_at":"2026-07-06T19:45:17.343568Z","submitted_at":"2024-11-05T04:10:59Z","title":"Specialized Foundation Models Struggle to Beat Supervised Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02796","snapshot_observed_at":"2026-08-07T05:27:50.063572Z","title":"Specialized foundation models struggle to beat supervised baselines, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.063572Z"},"links":{"cited_paper":"/paper/2411.02796","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:52c8af23d81162125e8bdbd043f6725832bb7c03d92d917baf32c13815d592d1","observation_id":"31994f1e-3fe7-43c4-8214-0e7b2ae186fb","resolution":{"observed_at":"2026-08-07T05:27:50.063572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16464","last_updated":"2025-06-16T22:23:37Z","snapshot_observed_at":"2026-08-09T15:09:11.494200Z","submitted_at":"2024-10-21T19:46:06Z","title":"Beyond Browsing: API-Based Web Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16464","snapshot_observed_at":"2026-08-07T05:27:50.058573Z","title":"Beyond browsing: Api-based web agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.058573Z"},"links":{"cited_paper":"/paper/2410.16464","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:4dc6c006b1a4a592ed62c6b44954526b673b029ff83d4e14f8929e82328c1b31","observation_id":"36464d1b-0192-4e76-a387-d80269b47128","resolution":{"observed_at":"2026-08-07T05:27:50.058573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.072815Z","title":"Codepde: An inference framework for llm-driven pde solver generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.072815Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:5320a27cbab6f0755488f1f8d4a2f0b1cb540fc14532941c8c2808e3cca96b7e","observation_id":"1673a028-4cea-4639-9415-9c471ed362ed","resolution":{"observed_at":"2026-08-07T05:27:50.072815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.30525","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:51.352292Z","title":"Mathematicalreconstruction of patient-specific vascular networks based on clinical images and global optimization.IEEE Access, 9:20648–20661, 2021","venue":null,"work_id":"c64c9c12-6b3a-4bf3-ab62-2526d83ed60d","year":2021},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.068419Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:0be45603a8040d727d56b2b0072de7e9570952a9192b8b520e7aebe371d94b9b","observation_id":"eec5d41f-f833-48d6-b881-eaf8ef0aa3f1","resolution":{"observed_at":"2026-08-07T05:27:51.359828Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-03T07:29:21.763809Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-07T05:27:50.081792Z","title":"Autonomous evaluation and refinement of digital agents.arXiv preprint arXiv:2404.06474, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.081792Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:65f7057be3cc00bff29177e02881866918812696b59367f5139182b40dad9ae7","observation_id":"6afcc4d2-0016-432e-894f-dc72072953cb","resolution":{"observed_at":"2026-08-07T05:27:50.081792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.077240Z","title":"Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, and Yu Su","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.077240Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:14a9e74fc4828e066554654aa511ff28f7848bfc8ca192e968d6a7e0a05e08ea","observation_id":"fa1c94fc-bec5-4f24-97dc-837b8fc42c2f","resolution":{"observed_at":"2026-08-07T05:27:50.077240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.091732Z","title":"NAS-bench-360: Benchmarking neural architecture search on diverse tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.091732Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:b19e9e0463393cd232989213a8a81c8619067e93d09ca43ea847ba6bdffaa282","observation_id":"49b1add7-ab27-4766-a8d4-f37558244ef0","resolution":{"observed_at":"2026-08-07T05:27:50.091732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.086748Z","title":"Efficient architecture search for diverse tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.086748Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:f67178e2e989cee03ac2849ae42d96176674e7dfbb2fd464dd85cb2e118eac2a","observation_id":"a3f94752-a38d-4e18-a4c9-34f70b9535a6","resolution":{"observed_at":"2026-08-07T05:27:50.086748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:27:50.101914Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.101914Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:4727a2ef11eda6e77978a6aef8bd5b655f5e847870be2c7205274e42c97e9477","observation_id":"2d07b871-658c-438a-bac7-013d87e93ae1","resolution":{"observed_at":"2026-08-07T05:27:50.101914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08978","last_updated":"2024-12-03T07:36:47Z","snapshot_observed_at":"2026-08-10T10:49:54.136232Z","submitted_at":"2024-03-13T22:06:03Z","title":"AutoGuide: Automated Generation and Selection of Context-Aware Guidelines for Large Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08978","snapshot_observed_at":"2026-08-07T05:27:50.097047Z","title":"Autoguide: Automated generation and selection of state-aware guidelines for large language model agents.arXiv preprint arXiv:2403.08978, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.097047Z"},"links":{"cited_paper":"/paper/2403.08978","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:7f6343c1bf698b9bf48668376082e1aec286ce6b6debc7e8a1cbb4f5bd6da345","observation_id":"53190f75-8c12-4061-819b-83c5ce2b16e4","resolution":{"observed_at":"2026-08-07T05:27:50.097047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03720","last_updated":"2024-08-08T18:00:48Z","snapshot_observed_at":"2026-08-09T20:00:17.176353Z","submitted_at":"2023-10-05T17:40:09Z","title":"SteP: Stacked LLM Policies for Web Actions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03720","snapshot_observed_at":"2026-08-07T05:27:50.112620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.112620Z"},"links":{"cited_paper":"/paper/2310.03720","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:ee89289133dcbd0765f8bfb686293c16467c0b7bfc52dd743b4d7d91df4a1408","observation_id":"1a34aa73-9276-4d55-bce1-999ed8db26ca","resolution":{"observed_at":"2026-08-07T05:27:50.112620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.107600Z","title":"Introducing the next generation of claude, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.107600Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:2149fbd99a7dcee94f31576a0bc8292c6738f0d56b26bcdf1f44033d37581b37","observation_id":"8804b0b2-2df3-496f-b15f-b57655461877","resolution":{"observed_at":"2026-08-07T05:27:50.107600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1101/2024.12.09.627422","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"L2g: Repurposing language models for genomics tasks.bioRxiv, 2024","venue":"bioRxiv (Cold Spring Harbor Laboratory)","work_id":"74aef13e-eb09-48ae-9d46-3b13a927f91e","year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.122811Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:8bf33160ee162ff1ec8ded4ca30bdc698136b34a074b4a736ffa41da7f60c69d","observation_id":"4f9b53d9-5f6b-44ea-921d-8b4f8965159e","resolution":{"observed_at":"2026-08-07T05:27:50.519540Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13032","last_updated":"2024-07-17T21:44:28Z","snapshot_observed_at":"2026-08-07T16:45:05.155981Z","submitted_at":"2024-07-17T21:44:28Z","title":"Agent-E: From Autonomous Web Navigation to Foundational Design Principles in Agentic Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13032","snapshot_observed_at":"2026-08-07T05:27:50.117392Z","title":"Agent-e: From autonomous web navigation to foundational design principles in agentic systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.117392Z"},"links":{"cited_paper":"/paper/2407.13032","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:65d1a9feae75729f9d3d539b20331126bc763c7d0679d34394f8010fdd769c0c","observation_id":"54d8756e-8452-4363-af5e-f212a5e09ba6","resolution":{"observed_at":"2026-08-07T05:27:50.117392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T05:27:50.132845Z","title":"Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.132845Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:31977ae9a6f6ec353752ea183c6717e2978af33f42d55fd883cbcad206238c1d","observation_id":"13a70ffe-bdf9-42cc-820c-2990f5b3de1d","resolution":{"observed_at":"2026-08-07T05:27:50.132845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.127713Z","title":"Plan-and-act: Improving planning of agents for long-horizon tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.127713Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:995832ff72bfe5f0e419cf4f0626f31753a4e6ac30f6f24095a0a25177627b08","observation_id":"aadaef5b-d9b0-4b7e-914c-8d70c7b2e53d","resolution":{"observed_at":"2026-08-07T05:27:50.127713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.141934Z","title":"Synapse: Trajectory-as-exemplar prompting with memory for computer control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.141934Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:2c23bd9e64723a94a0d34c86dfedd87588340c339797e8116c59295423f96687","observation_id":"2b0e1509-7fa7-46fc-bb9c-d5d47fae60f6","resolution":{"observed_at":"2026-08-07T05:27:50.141934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.137448Z","title":"Tree search for language model agents.arXiv preprint arXiv:2407.01476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.137448Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:b97ee95fcc4515ec06a0b8f345fa85e3bb29dd4eed82729c0cd3e1e0cac73fe0","observation_id":"685318d4-30dd-4025-b6f6-9a43ff82a03c","resolution":{"observed_at":"2026-08-07T05:27:50.137448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19054","last_updated":"2024-10-24T18:01:28Z","snapshot_observed_at":"2026-07-06T19:39:19.409512Z","submitted_at":"2024-10-24T18:01:28Z","title":"Infogent: An Agent-Based Framework for Web Information Aggregation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19054","snapshot_observed_at":"2026-08-07T05:27:50.151450Z","title":"Infogent: An agent-based framework for web information aggregation.ArXiv, abs/2410.19054, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.151450Z"},"links":{"cited_paper":"/paper/2410.19054","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:9d7970ca54671b460bce7ca2deab3216e7f834b893e22c53cc1b1a3498fd6ed4","observation_id":"d71d6456-f4ba-494c-ad2b-c75f9fd7a9a8","resolution":{"observed_at":"2026-08-07T05:27:50.151450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07429","last_updated":"2024-09-11T17:21:00Z","snapshot_observed_at":"2026-08-07T15:35:11.892405Z","submitted_at":"2024-09-11T17:21:00Z","title":"Agent Workflow Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07429","snapshot_observed_at":"2026-08-07T05:27:50.146703Z","title":"Agent workflow memory.arXiv preprint arXiv:2409.07429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.146703Z"},"links":{"cited_paper":"/paper/2409.07429","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:326537035ba651d1ca90c3e21d7f53a2f41a2b57681f1c8ef532e9f5f0d6a892","observation_id":"ced04181-8e51-4d3f-a178-d46bc6713b93","resolution":{"observed_at":"2026-08-07T05:27:50.146703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02907","last_updated":"2025-02-05T18:56:51Z","snapshot_observed_at":"2026-07-06T19:27:20.458797Z","submitted_at":"2024-10-03T18:56:51Z","title":"NNetNav: Unsupervised Learning of Browser Agents Through Environment Interaction in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02907","snapshot_observed_at":"2026-08-07T05:27:50.161004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.161004Z"},"links":{"cited_paper":"/paper/2410.02907","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:cb247f83a1e6c926d98eaa4587631d3b9af36b0183d57c92d4188e9b6736d188","observation_id":"06f7f655-bb64-4f40-afcd-152e367c51e6","resolution":{"observed_at":"2026-08-07T05:27:50.161004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08140","last_updated":"2024-06-09T01:12:26Z","snapshot_observed_at":"2026-07-06T17:43:40.149644Z","submitted_at":"2024-03-12T23:59:15Z","title":"BAGEL: Bootstrapping Agents by Guiding Exploration with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08140","snapshot_observed_at":"2026-08-07T05:27:50.156194Z","title":"Bagel: Boot- strapping agents by guiding exploration with language.arXiv preprint arXiv:2403.08140, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.156194Z"},"links":{"cited_paper":"/paper/2403.08140","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:2364cf27b24a80aeb7e2a776264f38ba2dddb7dc401a0f511e5293a31c9b6bef","observation_id":"d456d3ae-fae2-4423-93f2-60eae900fdc8","resolution":{"observed_at":"2026-08-07T05:27:50.156194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-07T05:27:50.171210Z","title":"Agent q: Advanced reasoning and learning for autonomous ai agents.ArXiv, abs/2408.07199, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.171210Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:735739518be195770063455f526257728a920684b466b5a49edc1e71eb8e8aca","observation_id":"d55730ce-385f-4afc-a5e0-314eacca5c59","resolution":{"observed_at":"2026-08-07T05:27:50.171210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06776","last_updated":"2025-05-22T17:59:11Z","snapshot_observed_at":"2026-08-08T15:07:58.758525Z","submitted_at":"2025-02-10T18:54:05Z","title":"InSTA: Towards Internet-Scale Training For Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06776","snapshot_observed_at":"2026-08-07T05:27:50.165917Z","title":"To- wards internet-scale training for agents.ArXiv, abs/2502.06776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.165917Z"},"links":{"cited_paper":"/paper/2502.06776","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:0b4a31416cb38f8aa7353a849d9d55d323572e2b4d9683dc7693da10b367f85c","observation_id":"1d96973f-8934-484e-96ed-85db71ef9fe8","resolution":{"observed_at":"2026-08-07T05:27:50.165917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14803","last_updated":"2025-02-21T16:23:59Z","snapshot_observed_at":"2026-07-06T19:36:15.200874Z","submitted_at":"2024-10-18T18:19:56Z","title":"DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14803","snapshot_observed_at":"2026-08-07T05:27:50.180946Z","title":"Distrl: An asyn- chronous distributed reinforcement learning framework for on-device control agents.ArXiv, abs/2410.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.180946Z"},"links":{"cited_paper":"/paper/2410.14803","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:37ad834c92829e44d89f8343b987a2b171c24f3dc89b0aec04f5bb525e3232f2","observation_id":"676a71e2-dc54-4ff5-a7d5-6368c6efeed1","resolution":{"observed_at":"2026-08-07T05:27:50.180946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.190059Z","title":"Autowebglm: A large language model-based web navigating agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.190059Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:ba2ec62322f222719db4ecade86949d57ee4e49b556f87bad460b4856ccc6ea7","observation_id":"8b248dad-5bae-4169-9705-11936e0f99f3","resolution":{"observed_at":"2026-08-07T05:27:50.190059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10893","last_updated":"2025-01-18T22:34:41Z","snapshot_observed_at":"2026-08-10T05:44:25.686261Z","submitted_at":"2025-01-18T22:34:41Z","title":"Learn-by-interact: A Data-Centric Framework for Self-Adaptive Agents in Realistic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10893","snapshot_observed_at":"2026-08-07T05:27:50.185457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.185457Z"},"links":{"cited_paper":"/paper/2501.10893","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:6fd31ac875bf00792586737572cf00288cccecee534e9da7a5041aae88e2d59f","observation_id":"7d7fb0f8-0099-41bb-b17b-ec095a7d0434","resolution":{"observed_at":"2026-08-07T05:27:50.185457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.199462Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.199462Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:23d31dd1aa987f36a8ce16cc9e4af090df714ad3dd1324bc62bcfc4f82d490bc","observation_id":"bbffbb6f-11ba-4bf9-ad32-37096acd9e55","resolution":{"observed_at":"2026-08-07T05:27:50.199462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T05:27:50.194755Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.ArXiv, abs/2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.194755Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:f0d6a5d40c3892e821457af26a0b9096c39f09efccccbae8041ea120333fd106","observation_id":"1ce53008-52cc-494b-86ab-20ecb88491ac","resolution":{"observed_at":"2026-08-07T05:27:50.194755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T05:27:50.215014Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning.ArXiv, abs/2410.08146, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.215014Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:5c2465af3308f9ef42329e4d5ba656745550b245813ecb207d9dce8db45fd45e","observation_id":"c0c9bf6e-b80f-4b5b-a185-9ab64d74dab3","resolution":{"observed_at":"2026-08-07T05:27:50.215014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.203966Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.203966Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:2a8d6fe02cface43ee0001511f68d65772a49e75b1aeae33ff4140b180ba013f","observation_id":"152980e0-619a-450c-b3ea-1fcf3e11b14d","resolution":{"observed_at":"2026-08-07T05:27:50.203966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:27:50.209389Z","title":"Training verifiers to solve math word problems.ArXiv, abs/2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.209389Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:32cbc0c9f75bf9c967c819cdc11a1634634db8e66d1530de57531421e0d709b2","observation_id":"fa309089-4b99-4995-a905-15f4f8aa3190","resolution":{"observed_at":"2026-08-07T05:27:50.209389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T05:27:50.229084Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.229084Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:a9860c91347315d2bf8314e16a2449457ef7f82f7b61138c856c98fe358e3fe4","observation_id":"8d2ad100-cff4-41f3-bf36-373daa431c22","resolution":{"observed_at":"2026-08-07T05:27:50.229084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T05:27:50.219788Z","title":"Scaling test- time compute without verification or rl is suboptimal.ArXiv, abs/2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.219788Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:0c2481fda915c7e95b2e5226a150801ad671907d6b0989f55606947862324ea3","observation_id":"f20f4c7f-9d7b-48aa-9f8d-bad1bab99af3","resolution":{"observed_at":"2026-08-07T05:27:50.219788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:27:50.224504Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learn- ing.ArXiv, abs/2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.224504Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:8c9b10cb58ab7ddaec68a6954bbf93df749e6eb37cf5b6e2f15b3bdd638a9ab1","observation_id":"091291ed-fe60-426f-8e65-4cd840c0a7cb","resolution":{"observed_at":"2026-08-07T05:27:50.224504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02052","last_updated":"2025-02-27T20:13:19Z","snapshot_observed_at":"2026-08-09T14:28:14.551525Z","submitted_at":"2024-10-02T21:42:35Z","title":"ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02052","snapshot_observed_at":"2026-08-07T05:27:50.242692Z","title":"Exact: Teachingaiagentstoexplorewithreflective-mctsandexploratorylearning.ArXiv, abs/2410.02052,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.242692Z"},"links":{"cited_paper":"/paper/2410.02052","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:740fb82fcb306ecb6f8ec7e66469baf11c725f8ee0270ddc73dea0c69e01b191","observation_id":"851db09b-90e5-403f-b4e4-5bf910310f59","resolution":{"observed_at":"2026-08-07T05:27:50.242692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.233594Z","title":"Doing: Agents that Reason by Scaling Test-Time Interaction Li Fei-Fei, Lijuan Wang, Yejin Choi, and Manling Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.233594Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:bffd9138339029b9fd57100f683ad6ef424b90602651a993225c029562bd274b","observation_id":"cd30e87b-425d-466d-9efe-fae298b462b5","resolution":{"observed_at":"2026-08-07T05:27:50.233594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T05:27:50.238031Z","title":"React: Synergizing reasoning and acting in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.238031Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:def71ad070725f4e007b03ebd9758bc295163617b808012962439dad6a756f91","observation_id":"4440afe6-8dfc-4d5f-abc1-c2c0225e657a","resolution":{"observed_at":"2026-08-07T05:27:50.238031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:27:50.261014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.261014Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:bdf500e049d18ce57e125800273849826af8ce4930ab4ede80f5e86c117340a9","observation_id":"3ffb19f0-0140-48e7-8833-c767f0609863","resolution":{"observed_at":"2026-08-07T05:27:50.261014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.248044Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.248044Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:2a6d93ec0d51e9435d4d211676ab43f7e9b18d16f11dc1f7a9feed940d8cb67d","observation_id":"f797f3bc-1f46-4808-baba-a0518dc4ac7a","resolution":{"observed_at":"2026-08-07T05:27:50.248044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T05:27:50.252400Z","title":"Generative verifiers: Reward modeling as next-token prediction.arXiv preprint arXiv:2408.15240, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.252400Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:6064e7d43b6272d2a643233362ebb90b0690a6836ddc5cd1856e21f656879af5","observation_id":"7decc3f5-3045-4f9f-83c9-60a869edd0d9","resolution":{"observed_at":"2026-08-07T05:27:50.252400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.256725Z","title":"Metaxas, and Tong Che","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.256725Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:055a8105f26b3b408ece3d68a273350aa26c458106bf5b84f14e67e766451414","observation_id":"f86bc6b7-2cb0-4312-a672-33b57d87547b","resolution":{"observed_at":"2026-08-07T05:27:50.256725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T05:27:50.279407Z","title":"Gemma 3 technical report.ArXiv, abs/2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.279407Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:e1d26b4c1735ab0e31d40ca748bcb494e025a70ebb8753d2b5513414d54922be","observation_id":"77754e79-1cbf-4898-8201-c5dc351d6c47","resolution":{"observed_at":"2026-08-07T05:27:50.279407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-08-10T03:47:52.773511Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-07T05:27:50.265548Z","title":"Pan, Wen Zhang, Huajun Chen, Fan Yang, Zenan Zhou, and Weipeng Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.265548Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:011e4fde9ae8870e142dbf96f9ccc50c2c98e2e54703d373cf5b99cdb80a596b","observation_id":"3e75664d-242b-41ec-8893-3ca685a33ef3","resolution":{"observed_at":"2026-08-07T05:27:50.265548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02522","last_updated":"2025-06-03T06:52:37Z","snapshot_observed_at":"2026-08-09T07:26:15.069564Z","submitted_at":"2025-06-03T06:52:37Z","title":"Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making","version":1},"cited_work":{"arxiv_id":"2506.02522","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02522","snapshot_observed_at":"2026-08-07T05:27:50.650205Z","title":"Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making","venue":"cs.AI","work_id":"1b4cd731-8e74-4650-aaa2-43f65c0e858c","year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.270831Z"},"links":{"cited_paper":"/paper/2506.02522","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:38f078ce0de729aa1329c9cc20712993f5c99af128fa58ef337cca2995dde53e","observation_id":"220a18c6-fc7e-4132-af06-b6ec616c7f4b","resolution":{"observed_at":"2026-08-07T05:27:50.656331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.275181Z","title":"Inducingprogrammaticskills for agentic tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.275181Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:d0696d2b1647e2de5aaf80c3a1e1a30c6e3a47f55b3679015e1bb6a563932c54","observation_id":"0ce756ea-20d6-49bd-aad0-b5ff70f3b8a7","resolution":{"observed_at":"2026-08-07T05:27:50.275181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.296869Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data, ICML 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.296869Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:b4897fa2b0634d990f3450b8a59e55c142bec38c5628ce7b0c58406ef1a7407c","observation_id":"ed329a50-5655-44a7-b005-4169833f405b","resolution":{"observed_at":"2026-08-07T05:27:50.296869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.284269Z","title":"Recursive introspection: Teaching language model agents how to self-improve.Advances in Neural Information Processing Systems, 37:55249–55285, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.284269Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:81c0a50596817228f811e8326dc229f47db3bc70ea90db32e095fab36b9e2a7f","observation_id":"b390b4ba-9c37-45ec-80a1-172b04fe4507","resolution":{"observed_at":"2026-08-07T05:27:50.284269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.288515Z","title":"Policy gradient methods for reinforcement learning with function approximation.Advances in neural information processing systems, 12, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.288515Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:8fbcd9979157c55b9e6690c40215ac6f5a46f93c3d5c5c1eaffbd85b54ad5503","observation_id":"ce0126c2-e4f5-4c92-9d46-635f7f59f1e8","resolution":{"observed_at":"2026-08-07T05:27:50.288515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.292630Z","title":"Star: Bootstrapping reasoning with reasoning.Advances in Neural Information Processing Systems, 35:15476–15488, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.292630Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:745681c15b63ce4a100d1bcad703fdd3650bd30ba9b233cfbec041458633b9c4","observation_id":"f7697213-ceef-4bd7-8e44-b5797144cee3","resolution":{"observed_at":"2026-08-07T05:27:50.292630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.315759Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.315759Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:6a8977150ad2101e81f37ead48b0d912b12d2d6614935d475f604c66816c3872","observation_id":"7d2e72d6-2e18-4952-8cb9-b2e854f50841","resolution":{"observed_at":"2026-08-07T05:27:50.315759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07246","last_updated":"2018-03-20T03:52:04Z","snapshot_observed_at":"2026-08-04T02:55:23.565483Z","submitted_at":"2018-03-20T03:52:04Z","title":"Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07246","snapshot_observed_at":"2026-08-07T05:27:50.301153Z","title":"Bayen, Sham M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.301153Z"},"links":{"cited_paper":"/paper/1803.07246","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:d006f4c8424e610e1131e316eb1625a1d6fcaef732422e3889d2cb18a490a40c","observation_id":"cbd4f959-4e53-4ac8-83e4-5f27f0f4ae15","resolution":{"observed_at":"2026-08-07T05:27:50.301153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.306536Z","title":"Analysis and improvement of policy gradient estimation.Neural networks : the official journal of the International Neural Network Society, 26:118–29, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.306536Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:d8ff48a7fcdf14284f2c1f7ab433b6ca011618c45210dc8b0b681af0417b995b","observation_id":"6d2b60f5-332e-4c81-b660-39eed0222f2d","resolution":{"observed_at":"2026-08-07T05:27:50.306536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.311083Z","title":"Policy gradients with variance related risk criteria","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.311083Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:f3f54cd0202b6e2438250d883d3455af71919a908aadfe78d2f67f46880c79c9","observation_id":"609c6309-f788-4fb4-a157-f8c10543abb8","resolution":{"observed_at":"2026-08-07T05:27:50.311083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.337973Z","title":"Abbeel, and Wojciech Zaremba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.337973Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:7d6a4aa33c3d2be4f19481698e374e1672255aab7c8cf7971eea810185209307","observation_id":"9f767eee-302f-4806-9f1e-e76b6adfd824","resolution":{"observed_at":"2026-08-07T05:27:50.337973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04960","last_updated":"2020-09-17T22:31:51Z","snapshot_observed_at":"2026-08-08T13:14:03.179732Z","submitted_at":"2020-03-10T20:41:24Z","title":"Curriculum Learning for Reinforcement Learning Domains: A Framework and Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04960","snapshot_observed_at":"2026-08-07T05:27:50.321017Z","title":"Taylor, and Peter Stone","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.321017Z"},"links":{"cited_paper":"/paper/2003.04960","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:c9404f653b5410912b413cf1b38387b0d98501d1686300a8d936047633640bdd","observation_id":"172aac69-c4d4-48ae-b132-497d208d9d69","resolution":{"observed_at":"2026-08-07T05:27:50.321017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.325733Z","title":"A survey on curriculum learning.IEEE Transac- tions on Pattern Analysis and Machine Intelligence, 44:4555–4576, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.325733Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:6ac6ba0591022566e92fd566a1fcf25cd735973cf369b709f7c7ceeb78f35341","observation_id":"cafc7a9e-4033-4ceb-9c39-b632f5253095","resolution":{"observed_at":"2026-08-07T05:27:50.325733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.333188Z","title":"Teacher–student curriculum learning.IEEE Transactions on Neural Networks and Learning Systems, 31:3732–3740, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.333188Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:59a2394d5929344b0f2c32d9d9ae553aadd155363044f7166b017633534a7273","observation_id":"b1f9382b-0b5b-4fd6-91eb-98eda6e4019d","resolution":{"observed_at":"2026-08-07T05:27:50.333188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T05:27:50.356815Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.356815Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:80415a9320200087e8d53023f9e39b0201494f2c143d23895260c5411f3fb1ea","observation_id":"e863c26d-93fc-486a-968c-e70c501dd59d","resolution":{"observed_at":"2026-08-07T05:27:50.356815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:50.342750Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.342750Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:394104bba0a02c32d4ef69f5a72d61fe0c495be356c926838d41b207afae4fbd","observation_id":"2fd4ebbe-7c12-42b7-a678-d5fcd0503597","resolution":{"observed_at":"2026-08-07T05:27:50.342750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:52.024366Z","title":null,"venue":null,"work_id":"01c3628c-bcb3-4071-8941-3c3909122d2a","year":2020},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.347566Z"},"links":{"citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:00cc41009c548540ac1cf8180db6ded89c744b73b38df01d711b5386ab81d017","observation_id":"44ee4768-89ff-4c53-a214-2e799dc215f0","resolution":{"observed_at":"2026-08-07T05:27:52.029289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T05:27:50.352214Z","title":"Ui-tars: Pioneering automated gui interaction with native agents.arXiv preprint arXiv:2501.12326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.352214Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:8980fdc6871dde889f0110d500d4508a2a648268f65dbe2492483e6baa761e24","observation_id":"e80e1f36-d90b-427f-af5d-37cd4c7e0990","resolution":{"observed_at":"2026-08-07T05:27:50.352214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":95,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":124},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 124 outbound references and 8 inbound Pith citation observations for arXiv:2506.07976."}