{"as_of":"2026-08-08T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26be49e550273547391eebb18c97b9bac07a77752176298111469a2e01fb2b33","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:34:34.819687Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-14T01:35:50.992477Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2410.09024"},"observation_digest":"sha256:f7d4d950f5d55303bb0dbe382c73236428153b56b2198bdc180d24cc0168d0d4","observation_id":"0ad1fd50-ca3d-45cd-9304-6f5c1a5f1f4f","resolution":{"observed_at":"2026-05-14T01:35:51.215921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2503.23278","last_updated":"2025-10-07T07:13:32Z","snapshot_observed_at":"2026-07-06T21:00:55.979837Z","submitted_at":"2025-03-30T01:58:22Z","title":"Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T09:02:40.294491Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2503.23278"},"observation_digest":"sha256:e649d542202afd2f47342ca3f2e814bd6fb0fef74ab6a9c94e1b14e7de72bf3d","observation_id":"9602fd78-0b64-4afa-9e40-bb39925730e3","resolution":{"observed_at":"2026-05-13T09:02:40.376710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T14:34:34.819687Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18471","last_updated":"2025-05-24T02:26:49Z","snapshot_observed_at":"2026-08-07T21:54:09.971572Z","submitted_at":"2025-05-24T02:26:49Z","title":"Invisible Tokens, Visible Bills: The Urgent Need to Audit Hidden Operations in Opaque LLM Services","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:34.819687Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2505.18471"},"observation_digest":"sha256:f2a43bb9de65563047c6f8e5e63b55e05024cd70e8a4cd91df7020a56df65c81","observation_id":"dbd88b35-1cd6-4f4d-a67a-46f92a7aa064","resolution":{"observed_at":"2026-08-07T14:34:34.819687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T14:12:01.284289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-08T09:25:43.689145Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:01.284289Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:f5fa5b42f3bb8d0349bd530ceaff37dfc506c0429770f94c7a0547b773e9ab19","observation_id":"55ff60d1-758d-4466-8142-ea7b84b5ab8c","resolution":{"observed_at":"2026-08-07T14:12:01.284289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T11:36:38.571897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01859","last_updated":"2025-06-02T16:48:11Z","snapshot_observed_at":"2026-08-07T23:24:20.735513Z","submitted_at":"2025-06-02T16:48:11Z","title":"CONFETTI: Conversational Function-Calling Evaluation Through Turn-Level Interactions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:36:38.571897Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.01859"},"observation_digest":"sha256:99db99d76d11f5ba99c656ef5d97a6eafc32dcd730d4e372026ef2f50c88070e","observation_id":"cd43e93d-4be5-4004-9d58-f5834c6c6f73","resolution":{"observed_at":"2026-08-07T11:36:38.571897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T07:52:17.174347Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.07982"},"observation_digest":"sha256:59179c441f8e4528853a14f7d6cce29c4bbbb821d7bd373ba7f6f0aa2827563f","observation_id":"f533e183-3092-407c-839d-ffecd6c4733d","resolution":{"observed_at":"2026-05-12T07:52:17.432112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T06:00:19.628526Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11102","last_updated":"2025-06-06T17:52:18Z","snapshot_observed_at":"2026-08-07T05:54:56.593167Z","submitted_at":"2025-06-06T17:52:18Z","title":"Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:19.628526Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.11102"},"observation_digest":"sha256:58ac80406b309a61eb493ab2ecebccdde82e29bb44cd0c4bec31dec7f521ed48","observation_id":"546c32d9-a530-4dc0-9c0d-1bde942dbe87","resolution":{"observed_at":"2026-08-07T06:00:19.628526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T23:26:54.497019Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18019","last_updated":"2025-07-04T14:29:40Z","snapshot_observed_at":"2026-08-07T07:31:09.988028Z","submitted_at":"2025-06-22T12:59:12Z","title":"Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities","version":3},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:54.497019Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.18019"},"observation_digest":"sha256:0bdc1faf78a8b5476b50f3c68bd9f982ff5591ba36afcc62e15a3f08944cfc12","observation_id":"90fb7440-f45f-4f79-b44e-d8638061cfa0","resolution":{"observed_at":"2026-08-06T23:26:54.497019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T21:48:47.975577Z","title":"arXiv preprint arXiv:2408.04682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23394","last_updated":"2025-06-29T20:47:27Z","snapshot_observed_at":"2026-08-07T20:47:43.953021Z","submitted_at":"2025-06-29T20:47:27Z","title":"Teaching a Language Model to Speak the Language of Tools","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:48:47.975577Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2506.23394"},"observation_digest":"sha256:05ad08c6d221cd7fcbd01b400ae57a4ee0cd1901612e46e9233b6a746a93e58f","observation_id":"4e5ac1d4-53b1-4a8f-881b-74a20ced8816","resolution":{"observed_at":"2026-08-06T21:48:47.975577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T16:26:58.622125Z","title":"Fanxu Meng, Zhaohui Wang, and Muhan Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13575","last_updated":"2025-08-27T16:34:47Z","snapshot_observed_at":"2026-08-06T16:19:23.253511Z","submitted_at":"2025-07-17T23:37:19Z","title":"Apple Intelligence Foundation Language Models: Tech Report 2025","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:26:58.622125Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.13575"},"observation_digest":"sha256:919e94d1015eae83733764cff639c341cf26d396d5ed49aa489123dca7f720f3","observation_id":"9c5b7e91-0ef3-44f7-ba03-612cb3886353","resolution":{"observed_at":"2026-08-06T16:26:58.622125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T15:39:57.418255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15296","last_updated":"2025-07-21T06:55:37Z","snapshot_observed_at":"2026-08-06T15:33:04.507427Z","submitted_at":"2025-07-21T06:55:37Z","title":"Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:39:57.418255Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.15296"},"observation_digest":"sha256:13c2fd0da0e687cccf93f3d8659b4b10e5f96cb7c2a1da14a6ba322515e9e92e","observation_id":"2065dfca-4776-4ec4-b6fd-34ad20d7434b","resolution":{"observed_at":"2026-08-06T15:39:57.418255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T15:34:30.254612Z","title":"Harsh Jhamtani, Hao Fang, Patrick Xia, Eran Levy, Ja- cob Andreas, and Ben Van Durme","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15501","last_updated":"2025-07-21T11:07:05Z","snapshot_observed_at":"2026-08-06T15:28:09.314982Z","submitted_at":"2025-07-21T11:07:05Z","title":"ASPERA: A Simulated Environment to Evaluate Planning for Complex Action Execution","version":1},"reference_index":4976,"source":"pdf_text","source_observed_at":"2026-08-06T15:34:30.254612Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.15501"},"observation_digest":"sha256:e36bf10089198a5ca9c01f4e51d179708ab19a9200b3417727d39bf923278a19","observation_id":"17b85ac1-5fe6-4332-a284-bd791f769b3d","resolution":{"observed_at":"2026-08-06T15:34:30.254612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T14:57:06.486170Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17257","last_updated":"2025-07-23T06:56:15Z","snapshot_observed_at":"2026-08-06T18:04:24.113657Z","submitted_at":"2025-07-23T06:56:15Z","title":"Agent Identity Evals: Measuring Agentic Identity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:57:06.486170Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.17257"},"observation_digest":"sha256:98c6b13838621bea9b9e9e8799edeac48298616fb132c347569c3ae53226d673","observation_id":"8985ac9c-af6b-44df-94c6-5f026bf80eae","resolution":{"observed_at":"2026-08-06T14:57:06.486170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:6b839f141c51515f9db6c7dca02bf7bda5266929cd2769c1391b6ec5dfbff4a2","observation_id":"384f4a7a-5d99-4c71-ad96-646df71eaa06","resolution":{"observed_at":"2026-05-14T22:23:15.733725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T12:09:26.408309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22034","last_updated":"2025-07-29T17:34:12Z","snapshot_observed_at":"2026-08-07T20:29:47.386254Z","submitted_at":"2025-07-29T17:34:12Z","title":"UserBench: An Interactive Gym Environment for User-Centric Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:26.408309Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2507.22034"},"observation_digest":"sha256:fe7e9bdd8ef6e7ebe5004411dbab72a3ddfd3e7c75fbddd6942970b68a1d957d","observation_id":"32adb8cd-f031-49ee-82e3-dc87d140ae16","resolution":{"observed_at":"2026-08-06T12:09:26.408309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T17:57:28.102393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15456","last_updated":"2025-08-21T11:22:57Z","snapshot_observed_at":"2026-08-08T13:59:17.197314Z","submitted_at":"2025-08-21T11:22:57Z","title":"PyTOD: Programmable Task-Oriented Dialogue with Execution Feedback","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T17:57:28.102393Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2508.15456"},"observation_digest":"sha256:c43e166bfc4c9b35ed7c4bb100b041d9f3988afcfbf61c7881ea011853e83f3b","observation_id":"96b63d17-0dd0-4f62-96de-03c8dc107cf8","resolution":{"observed_at":"2026-08-05T17:57:28.102393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T14:49:00.685400Z","title":"arXiv preprint arXiv:2408.04682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20931","last_updated":"2025-09-01T18:05:06Z","snapshot_observed_at":"2026-08-06T12:07:20.093124Z","submitted_at":"2025-08-28T15:57:33Z","title":"How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $\\tau$-bench","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:49:00.685400Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2508.20931"},"observation_digest":"sha256:15917f16d5a0c7ce373221c6dd0110f27e5625a1e111c62a2e7a47e302667feb","observation_id":"dcde5d88-8512-4bb9-bea9-bbb2d01f6287","resolution":{"observed_at":"2026-08-05T14:49:00.685400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2510.07043","last_updated":"2026-04-16T19:10:44Z","snapshot_observed_at":"2026-08-02T21:31:45.999075Z","submitted_at":"2025-10-08T14:09:46Z","title":"COMPASS: Benchmarking Constrained Optimization in LLM Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T08:45:11.334594Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2510.07043"},"observation_digest":"sha256:9289fe6a046e70e5cd2b01b285bc029a59700c3756393aee2f336da599f9a515","observation_id":"2acc08f8-df26-4463-b47c-75c18ec09782","resolution":{"observed_at":"2026-05-18T08:46:07.880209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-03T18:03:37.341452Z","title":"Controlllm: Augment language models with tools by searching on graphs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07287","last_updated":"2026-06-28T11:58:42Z","snapshot_observed_at":"2026-08-05T13:20:26.960914Z","submitted_at":"2025-12-08T08:27:24Z","title":"Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:03:37.341452Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2512.07287"},"observation_digest":"sha256:08e37c98fccf08273cc8ecb47d48f7badd2e2b8c9160d3b4eb961808476d70a8","observation_id":"cdcb1055-214e-49e5-9335-e7073b300fa1","resolution":{"observed_at":"2026-08-03T18:03:37.341452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-03T14:20:31.274272Z","title":"Toolsand- box: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities.arXiv preprint arXiv:2408.04682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20957","last_updated":"2026-05-26T05:07:52Z","snapshot_observed_at":"2026-08-03T18:14:05.259857Z","submitted_at":"2025-12-24T05:27:53Z","title":"One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:31.274272Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2512.20957"},"observation_digest":"sha256:3bb94c3581e469ab62d565531a5687c46686685642199e9be96a93dc564d45bd","observation_id":"cbc00d68-b687-49dd-93f7-3e8128ef1c4f","resolution":{"observed_at":"2026-08-03T14:20:31.274272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-02T21:46:33.312636Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation bench- mark for llm tool use capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19218","last_updated":"2026-06-09T15:02:00Z","snapshot_observed_at":"2026-08-05T17:29:43.215311Z","submitted_at":"2026-02-22T15:02:00Z","title":"Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:46:33.312636Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2602.19218"},"observation_digest":"sha256:ce2b838c479ca21f7fd01f86951b5ea7c710337d2581f0e002f7faeb13f0c606","observation_id":"7671de91-1088-487d-ae66-8bcdfc4e3373","resolution":{"observed_at":"2026-08-02T21:46:33.312636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-04T05:51:29.394088Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11245","last_updated":"2026-07-31T22:23:28Z","snapshot_observed_at":"2026-08-08T21:24:42.455948Z","submitted_at":"2026-03-11T19:12:31Z","title":"Mind the Sim2Real Gap in User Simulation for Agentic Tasks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T05:51:29.394088Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2603.11245"},"observation_digest":"sha256:fee3c58f789086eda48ba64855a60a129c7f6545e80d3cb3cd190bad9bf54513","observation_id":"1e99cad8-ad5f-4498-af27-6b33117f8164","resolution":{"observed_at":"2026-08-04T05:51:29.394088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2603.14987","last_updated":"2026-05-21T06:24:06Z","snapshot_observed_at":"2026-08-03T21:30:30.993382Z","submitted_at":"2026-03-16T08:51:33Z","title":"Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T10:19:56.003219Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2603.14987"},"observation_digest":"sha256:7db2f19d0302e4feaccab8e2b3bac9b8c8b7eb26afeee162609850a3dacc1eba","observation_id":"303b2907-089e-4a5c-b292-3012610353e9","resolution":{"observed_at":"2026-05-22T10:21:23.276299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-07-13T09:29:51.204678Z","title":"Kevin Lu and Thinking Machines Lab","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.05333","last_updated":"2026-05-27T08:01:13Z","snapshot_observed_at":"2026-07-13T09:29:44.671622Z","submitted_at":"2026-04-07T02:09:11Z","title":"Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T09:29:51.204678Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.05333"},"observation_digest":"sha256:397b4653e6589c0af952214a16c3716c95f9f712aa305266ac38d98f921df057","observation_id":"f512d45f-3c96-4cc1-8cb9-a12791cb8bc4","resolution":{"observed_at":"2026-07-13T09:29:51.204678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2604.12116","last_updated":"2026-05-24T06:41:18Z","snapshot_observed_at":"2026-08-02T05:40:32.176239Z","submitted_at":"2026-04-13T22:50:21Z","title":"The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:26.128263Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.12116"},"observation_digest":"sha256:2639bb7a9075c3f5098c876929ce29846adbb4ea964dc2b69df4976742bbdf30","observation_id":"b64fd55d-3560-4fae-b973-1d1382b4c779","resolution":{"observed_at":"2026-05-11T10:41:02.948205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-07-12T21:35:10.173253Z","title":"Available: http://arxiv.org/abs/2408.04682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.12116","last_updated":"2026-05-24T06:41:18Z","snapshot_observed_at":"2026-08-02T05:40:32.176239Z","submitted_at":"2026-04-13T22:50:21Z","title":"The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T21:35:10.173253Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.12116"},"observation_digest":"sha256:5ffbb7cd7b330451a5d5664ed3932ba997afe20aa31b6ae993e1db41103f31b3","observation_id":"cb9d7391-7d34-42db-a282-a7f59a02b766","resolution":{"observed_at":"2026-07-12T21:35:10.173253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2604.25318","last_updated":"2026-04-28T07:28:14Z","snapshot_observed_at":"2026-08-01T08:58:27.586129Z","submitted_at":"2026-04-28T07:28:14Z","title":"Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T14:01:23.894966Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2604.25318"},"observation_digest":"sha256:3bc929fef2ee01e9487e5c249a0fd72afd3eea5012d08b38b2931d7195c4d873","observation_id":"a9d309d2-bd28-4d6d-b504-e79a0a1ae000","resolution":{"observed_at":"2026-05-12T08:41:25.973584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:138f6c54696692af92a381754be9e0112749b9c2510390bd744a08f329234994","observation_id":"78643d9a-d7a8-4f1b-9013-46192bceb7f3","resolution":{"observed_at":"2026-05-22T05:51:07.975780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:bf1580d382e797cc94fb71a128ce2d13966a74835338849f38e639a88bf4b0ff","observation_id":"bf0365b3-03c4-4603-84ae-bfa4a8c932e4","resolution":{"observed_at":"2026-05-25T06:06:43.057004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2605.27141","last_updated":"2026-05-26T15:07:38Z","snapshot_observed_at":"2026-07-06T23:36:53.330986Z","submitted_at":"2026-05-26T15:07:38Z","title":"VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T17:10:02.936605Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2605.27141"},"observation_digest":"sha256:8b3e6247841efb94bc68f094a7ba63a58811a5f5fead334a9aa8041ed07737d6","observation_id":"77ad442d-6a89-4507-8670-4154703a5604","resolution":{"observed_at":"2026-06-29T17:13:44.721016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2606.02965","last_updated":"2026-08-03T20:59:18Z","snapshot_observed_at":"2026-08-07T23:09:28.856830Z","submitted_at":"2026-06-01T23:52:56Z","title":"Designing for Doubt: The Case for Informed Abstention in Autonomous Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T14:03:02.703499Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2606.02965"},"observation_digest":"sha256:8ff058cd6606c4ecb251794c57ab9d61f379d5aa469b7b9a3b1e27d294c80ed4","observation_id":"5df495e5-804e-45c2-8469-186133156986","resolution":{"observed_at":"2026-07-01T23:46:23.684356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2606.18051","last_updated":"2026-06-16T15:27:55Z","snapshot_observed_at":"2026-08-07T03:31:46.971110Z","submitted_at":"2026-06-16T15:27:55Z","title":"Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T00:37:50.570757Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2606.18051"},"observation_digest":"sha256:9ebf5812d31dbc68b7df77b94deaf41410a2ea786c4967efa6e7b952bd01d868","observation_id":"5fa44723-d6a5-4bca-a7d3-fb6e66293b35","resolution":{"observed_at":"2026-07-03T21:18:59.725697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":"2408.04682","doi":"10.48550/arxiv.2408.04682","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.04682 , year=","venue":"arXiv (Cornell University)","work_id":"8ebe329b-bd4c-46ed-8688-166c2e971caa","year":2024},"citing_paper":{"arxiv_id":"2607.01465","last_updated":"2026-07-01T20:55:07Z","snapshot_observed_at":"2026-08-08T13:34:00.921694Z","submitted_at":"2026-07-01T20:55:07Z","title":"Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-03T20:18:07.134598Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2607.01465"},"observation_digest":"sha256:4e82380e130bf68027b852c0813b2a3eba6747a926c692a6d6ef7e998e5ad889","observation_id":"91ffc82a-47cf-4552-9eec-f94d765e5ebb","resolution":{"observed_at":"2026-07-03T20:18:55.533094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-02T07:36:53.348031Z","title":"ToolSandbox : A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.348031Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:194692c8d58c44372bf75241eb04f153f11e4ae646c5ecf85af4689768cdbc79","observation_id":"29be73f0-dce0-478d-bf47-45b0d02832d4","resolution":{"observed_at":"2026-08-02T07:36:53.348031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-07T00:14:06.175548Z","title":"ToolSandbox: A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02713","last_updated":"2026-08-03T17:59:58Z","snapshot_observed_at":"2026-08-07T23:09:56.055766Z","submitted_at":"2026-08-03T17:59:58Z","title":"Quo Vadis, World Modeling?","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:06.175548Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2608.02713"},"observation_digest":"sha256:92cea9c14f6bb14b6ec943849d2621f223f2ad7a43b6cdf35bb0d41e12511871","observation_id":"63af01f3-1fd4-4326-a9cd-47ddd31efa8f","resolution":{"observed_at":"2026-08-07T00:14:06.175548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-06T18:11:39.396840Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04719","last_updated":"2026-08-05T11:38:33Z","snapshot_observed_at":"2026-08-08T22:12:49.671384Z","submitted_at":"2026-08-05T11:38:33Z","title":"Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:39.396840Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2608.04719"},"observation_digest":"sha256:faef8bac23cb3ee0e520973cb36650e8bc1a82c11da720796f10776d12b46c6e","observation_id":"5eea9802-d3ed-463f-8f49-be91be9f9510","resolution":{"observed_at":"2026-08-06T18:11:39.396840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.04682/citation-record","integrity":"/paper/2408.04682/integrity","json":"/paper/2408.04682/citation-record.json","paper":"/paper/2408.04682"},"outbound":[],"paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2408.04682."}