{"as_of":"2026-08-16T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ca83b55474790209d97969c8135d1977f02a914ac9b38e250f5424d3b8d577f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:35:04.819123Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:05:47.294068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:55:40.559308Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"cited_work":{"arxiv_id":"2508.11027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11027","snapshot_observed_at":"2026-07-01T09:55:40.559308Z","title":"arXiv:2508.11027 [cs.CL] https://arxiv.org/abs/2508.11027","venue":null,"work_id":"45788048-63d8-4d18-ab9b-0c13c2d57fc4","year":null},"citing_paper":{"arxiv_id":"2605.03409","last_updated":"2026-05-18T03:21:07Z","snapshot_observed_at":"2026-08-14T22:45:24.653713Z","submitted_at":"2026-05-05T06:27:34Z","title":"Robust Agent Compensation (RAC): Teaching AI Agents to Compensate","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:15.433189Z"},"links":{"cited_paper":"/paper/2508.11027","citing_paper":"/paper/2605.03409"},"observation_digest":"sha256:10fe56baccf8047e80943f723fd14cc9e1eaa6b33ced012e423c3e0a37ca75af","observation_id":"9c3c0eba-9da5-4d37-9924-5c6c4ef896d5","resolution":{"observed_at":"2026-05-12T11:01:30.457941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"cited_work":{"arxiv_id":"2508.11027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11027","snapshot_observed_at":"2026-07-01T09:55:40.559308Z","title":"arXiv:2508.11027 [cs.CL] https://arxiv.org/abs/2508.11027","venue":null,"work_id":"45788048-63d8-4d18-ab9b-0c13c2d57fc4","year":null},"citing_paper":{"arxiv_id":"2605.03409","last_updated":"2026-05-18T03:21:07Z","snapshot_observed_at":"2026-08-14T22:45:24.653713Z","submitted_at":"2026-05-05T06:27:34Z","title":"Robust Agent Compensation (RAC): Teaching AI Agents to Compensate","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T00:22:54.128310Z"},"links":{"cited_paper":"/paper/2508.11027","citing_paper":"/paper/2605.03409"},"observation_digest":"sha256:36bfc488249124d4a0b3e353f228e8688d638c1023d5de2379f76acf563fe2f1","observation_id":"0adb1785-cff9-4e83-beb7-24b80ffce843","resolution":{"observed_at":"2026-05-21T00:23:52.457861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"cited_work":{"arxiv_id":"2508.11027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11027","snapshot_observed_at":"2026-07-01T09:55:40.559308Z","title":"arXiv:2508.11027 [cs.CL] https://arxiv.org/abs/2508.11027","venue":null,"work_id":"45788048-63d8-4d18-ab9b-0c13c2d57fc4","year":null},"citing_paper":{"arxiv_id":"2606.31307","last_updated":"2026-06-30T08:18:11Z","snapshot_observed_at":"2026-08-15T17:13:04.840640Z","submitted_at":"2026-06-30T08:18:11Z","title":"When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T06:05:47.294068Z"},"links":{"cited_paper":"/paper/2508.11027","citing_paper":"/paper/2606.31307"},"observation_digest":"sha256:84bc3171302d0b10d640c035b8ad4d794ebef5384a50a01a55bafe8f5ec742dc","observation_id":"d82411c5-65f6-4a75-be0b-952622749dbd","resolution":{"observed_at":"2026-07-01T09:55:40.560856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.11027/citation-record","integrity":"/paper/2508.11027/integrity","json":"/paper/2508.11027/citation-record.json","paper":"/paper/2508.11027"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T17:35:04.570607Z","title":"Evaluating large language models trained on code, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.570607Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:0fb58fcbc8dbeb271fd5c5243321dc0e9033059bf4cd3e4b83b3d9b06ede637f","observation_id":"e7be9ab1-4521-419e-877a-27faf18df70e","resolution":{"observed_at":"2026-08-15T17:35:04.570607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05128","last_updated":"2023-10-05T09:12:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-11T10:43:43Z","title":"Teaching Large Language Models to Self-Debug","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05128","snapshot_observed_at":"2026-08-15T17:35:04.581696Z","title":"Teaching large language models to self-debug, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.581696Z"},"links":{"cited_paper":"/paper/2304.05128","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:f7de6c6e7ed91c12c675b36604ee8efa1ccf9d0d856a0ce41dc10f5489c34d56","observation_id":"69b255ff-cd94-48b1-904a-8db69fe30c74","resolution":{"observed_at":"2026-08-15T17:35:04.581696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14323","last_updated":"2023-11-06T11:00:26Z","snapshot_observed_at":"2026-08-16T15:30:30.827508Z","submitted_at":"2023-05-23T17:54:33Z","title":"ChatCoT: Tool-Augmented Chain-of-Thought Reasoning on Chat-based Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14323","snapshot_observed_at":"2026-08-15T17:35:04.588917Z","title":"Chatcot: Tool-augmented chain-of-thought reasoning on chat-based large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.588917Z"},"links":{"cited_paper":"/paper/2305.14323","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:aba3a79538bb652007b8382063a4b7f448144e05ed07cdcd185c544b4d5e1451","observation_id":"86078d18-7922-4534-a362-c275eb6ccb9e","resolution":{"observed_at":"2026-08-15T17:35:04.588917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04253","last_updated":"2024-02-06T18:59:57Z","snapshot_observed_at":"2026-08-16T14:20:53.086877Z","submitted_at":"2024-02-06T18:59:57Z","title":"AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API Calls","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04253","snapshot_observed_at":"2026-08-15T17:35:04.595115Z","title":"Anytool: Self-reflective, hierarchical agents for large-scale api calls, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.595115Z"},"links":{"cited_paper":"/paper/2402.04253","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:a34449e12bb3d2d6f7768818caa1e5b2d35c40ee86abc074e00d454cd0d05743","observation_id":"5b5c3286-c8f7-41fb-a2a6-e062187493a2","resolution":{"observed_at":"2026-08-15T17:35:04.595115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T17:35:04.601215Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.601215Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:30bd3a168b87389ce645a13685f500cfc18081dc3664bb4a461e673e95b9d4fe","observation_id":"c7164496-35eb-4b23-bfad-11bc1ce8a902","resolution":{"observed_at":"2026-08-15T17:35:04.601215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-15T17:35:04.607118Z","title":"Critic: Large language models can self-correct with tool-interactive critiquing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.607118Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:604a0ec7b10fb42ad15c90ed06cae4d449f231fb506b3615df1049053afbed20","observation_id":"26d9cb98-d90e-4767-bd61-7325d99c7da5","resolution":{"observed_at":"2026-08-15T17:35:04.607118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11554","last_updated":"2024-01-15T23:52:21Z","snapshot_observed_at":"2026-08-16T15:31:45.593078Z","submitted_at":"2023-05-19T09:54:21Z","title":"ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11554","snapshot_observed_at":"2026-08-15T17:35:04.613057Z","title":"Toolkengpt: Augmenting frozen language models with massive tools via tool embeddings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.613057Z"},"links":{"cited_paper":"/paper/2305.11554","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:28fd8b0c34a28b048f8d0d7a85a261d46856e4537d0fe493abc82a35cecb3ce0","observation_id":"aeacd5d1-46f9-4b70-ada7-6bb6f5f6d577","resolution":{"observed_at":"2026-08-15T17:35:04.613057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T17:35:04.618128Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.618128Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:09a791f2329f8249ca6a44381bb494d5206e67f52ba453a20f7d0507afe965bb","observation_id":"7ee430b8-f4d6-4960-bcf1-b0529eafa17d","resolution":{"observed_at":"2026-08-15T17:35:04.618128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01748","last_updated":"2024-10-02T17:01:10Z","snapshot_observed_at":"2026-08-16T13:13:16.279132Z","submitted_at":"2024-10-02T17:01:10Z","title":"Not All LLM Reasoners Are Created Equal","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01748","snapshot_observed_at":"2026-08-15T17:35:04.623901Z","title":"Not all llm reasoners are created equal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.623901Z"},"links":{"cited_paper":"/paper/2410.01748","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:fa12360ad5ffb84c859319eaf11c18c592d47047890eebecc4a85f2fe9961d65","observation_id":"9158879b-5bb3-4b4e-b9e0-dbe9c8be432d","resolution":{"observed_at":"2026-08-15T17:35:04.623901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17218","last_updated":"2025-06-29T16:35:17Z","snapshot_observed_at":"2026-08-16T13:06:53.768505Z","submitted_at":"2024-10-22T17:43:39Z","title":"Creativity in AI: Progresses and Challenges","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17218","snapshot_observed_at":"2026-08-15T17:35:04.629737Z","title":"Creativity in ai: Progresses and challenges, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.629737Z"},"links":{"cited_paper":"/paper/2410.17218","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:dcb6bf47b03db0046f02ea2f16d8394cd7c0297c19878f64d464fab88b3e7b60","observation_id":"65f5f28c-1edc-420c-a0fd-2972f5e3973a","resolution":{"observed_at":"2026-08-15T17:35:04.629737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:04.637475Z","title":"Feedback friction: Llms struggle to fully incorporate external feedback, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.637475Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:e32e5d0aa236cfe7c6461959efb5a8cd51ac21dcda1e062aec6ef5d66c6ce4a6","observation_id":"9e97a6f0-fb64-4a58-abf3-4ed741cb1c8c","resolution":{"observed_at":"2026-08-15T17:35:04.637475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04474","last_updated":"2024-07-29T20:21:37Z","snapshot_observed_at":"2026-08-16T14:36:45.583038Z","submitted_at":"2023-12-07T17:51:43Z","title":"Chain of Code: Reasoning with a Language Model-Augmented Code Emulator","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04474","snapshot_observed_at":"2026-08-15T17:35:04.642526Z","title":"Chain of code: Reasoning with a language model-augmented code emulator, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.642526Z"},"links":{"cited_paper":"/paper/2312.04474","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:255a42847b6692e2750d9d272a58303b138ed443182f52059fd39960eb9193e0","observation_id":"741ba194-7da5-48fd-be8f-1366c203fa9b","resolution":{"observed_at":"2026-08-15T17:35:04.642526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:05.925753Z","title":"Api-bank: A benchmark for tool-augmented llms","venue":null,"work_id":"8daa1865-a2b9-4728-b361-89ef883298bb","year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.648302Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:dbeb75d2a5500e353088cb9930297b34269a0fe90c47ad78cd6c559cdb91750b","observation_id":"814c3afb-4b6c-4c02-934a-1bed1aaa7ccd","resolution":{"observed_at":"2026-08-15T17:35:05.932190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-16T13:27:47.353876Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-15T17:35:04.652799Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.652799Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:2f188a62f19ee964520f394cc840f59617fffb28ad57366f81c1791285861988","observation_id":"c8254a3f-bd8b-4506-bc88-76b597e87b29","resolution":{"observed_at":"2026-08-15T17:35:04.652799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08775","last_updated":"2024-01-31T04:11:42Z","snapshot_observed_at":"2026-08-16T15:15:34.572025Z","submitted_at":"2023-07-17T18:42:05Z","title":"GEAR: Augmenting Language Models with Generalizable and Efficient Tool Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08775","snapshot_observed_at":"2026-08-15T17:35:04.657890Z","title":"GEAR: augmenting language models with generalizable and efficient tool resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.657890Z"},"links":{"cited_paper":"/paper/2307.08775","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:b36d2a56eccb9d306e06150fb511aadc0ee73e6958b69ae6364a0baf56089218","observation_id":"1bcfe983-083a-40b5-b0cf-ef6fc35cdb95","resolution":{"observed_at":"2026-08-15T17:35:04.657890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09007","last_updated":"2025-02-08T19:32:51Z","snapshot_observed_at":"2026-08-16T13:34:52.571650Z","submitted_at":"2024-07-12T05:55:22Z","title":"Benchmarking Language Model Creativity: A Case Study on Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09007","snapshot_observed_at":"2026-08-15T17:35:04.662940Z","title":"Benchmarking language model creativity: A case study on code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.662940Z"},"links":{"cited_paper":"/paper/2407.09007","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:e496a03d7cb1b44093ebe5329b328a08d62f1cb868bd2a386b7c5c4b25e68e39","observation_id":"250807b2-2fa2-4e0e-8ca5-cf06a0b6d7d3","resolution":{"observed_at":"2026-08-15T17:35:04.662940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:05.907908Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"206dcd5e-612f-4193-af75-557fe3bd65df","year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.667737Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:e98c84eee6dc8da4bfaf5940c067e2ddc8a2f870a6109196ce83e1a451e3e33f","observation_id":"085a074b-e743-4ed1-ad98-aec6a4b0dba5","resolution":{"observed_at":"2026-08-15T17:35:05.913259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12255","last_updated":"2022-05-24T17:58:13Z","snapshot_observed_at":"2026-08-16T16:57:58.786548Z","submitted_at":"2022-05-24T17:58:13Z","title":"TALM: Tool Augmented Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12255","snapshot_observed_at":"2026-08-15T17:35:04.673499Z","title":"Talm: Tool augmented language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.673499Z"},"links":{"cited_paper":"/paper/2205.12255","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:90b5aa6ec536915bd13dc62b9f00a7fbc19c4e152ae5b269129907bb0fac323e","observation_id":"103481f0-5e4e-4254-ab21-8a132555ba2b","resolution":{"observed_at":"2026-08-15T17:35:04.673499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-14T14:07:14.900729Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-15T17:35:04.678437Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.678437Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:be94fa8a2070fd83e2e1f1a4aa0db633477c8d4d172aaab16dc98074526b7a19","observation_id":"ee7ba190-35e7-452c-8664-caede273682a","resolution":{"observed_at":"2026-08-15T17:35:04.678437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13549","last_updated":"2025-05-24T04:56:32Z","snapshot_observed_at":"2026-08-14T08:15:00.493388Z","submitted_at":"2024-12-18T06:50:39Z","title":"EscapeBench: Towards Advancing Creative Intelligence of Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13549","snapshot_observed_at":"2026-08-15T17:35:04.683908Z","title":"Escapebench: Pushing language models to think outside the box, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.683908Z"},"links":{"cited_paper":"/paper/2412.13549","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:0db298db035402a92dbe39b5b5e40c5ef6a99ec5049dc6afb69b8763169ccf8a","observation_id":"2708f164-0128-422e-971f-a02351dac6cf","resolution":{"observed_at":"2026-08-15T17:35:04.683908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13068","last_updated":"2024-03-14T08:15:27Z","snapshot_observed_at":"2026-08-16T15:31:04.894486Z","submitted_at":"2023-05-22T14:37:05Z","title":"Making Language Models Better Tool Learners with Execution Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13068","snapshot_observed_at":"2026-08-15T17:35:04.689047Z","title":"Making language models better tool learners with execution feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.689047Z"},"links":{"cited_paper":"/paper/2305.13068","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:ac29508d0c53a05e07dae76c5afc6a9fdf4ddbbc61f668bbf56b26262c29dd1a","observation_id":"f7455207-d292-4bce-a197-55269bc3314d","resolution":{"observed_at":"2026-08-15T17:35:04.689047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08354","last_updated":"2024-08-06T15:14:36Z","snapshot_observed_at":"2026-08-15T21:51:52.440582Z","submitted_at":"2023-04-17T15:16:10Z","title":"Tool Learning with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08354","snapshot_observed_at":"2026-08-15T17:35:04.694571Z","title":"Tool learning with foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.694571Z"},"links":{"cited_paper":"/paper/2304.08354","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:a6b61739dc51999e53484d6658c4fa550d25e76903cf6c32eee19caca454e3d8","observation_id":"e5cb56fe-b445-4770-b59f-314d345d9320","resolution":{"observed_at":"2026-08-15T17:35:04.694571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-15T17:35:04.700385Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.700385Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:c2a6c70077481798f8b68409dc74f6e25c05e68156cbdcd16173613e29acb9f6","observation_id":"a18fdcfc-245c-47e3-a709-6c0ad197b9b4","resolution":{"observed_at":"2026-08-15T17:35:04.700385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T17:35:04.705490Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.705490Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:af89918cf098fbaef88c248a59727f7e36c8d957243333a294333c6e4b574ac1","observation_id":"98c7743f-3199-4ff2-a7eb-fafdf924c562","resolution":{"observed_at":"2026-08-15T17:35:04.705490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-08-13T17:24:30.719766Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-15T17:35:04.711079Z","title":"Self-critiquing models for assisting human evaluators, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.711079Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:fce80afe415bca836372a13289b02acff02a72ab6678d69f18c9697032c1b52d","observation_id":"022af19a-0b06-47bb-8342-8da9b9302231","resolution":{"observed_at":"2026-08-15T17:35:04.711079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-15T17:35:04.718094Z","title":"ToolFormer: language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.718094Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:58e5bfaf159b47e14c55ff690b0f775902154d5e6278709d8ecbd229462080b8","observation_id":"6bc8ebe8-cb12-4d80-8080-dd0908b53d68","resolution":{"observed_at":"2026-08-15T17:35:04.718094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-15T16:12:25.059113Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-15T17:35:04.724861Z","title":"Reflexion: an autonomous agent with dynamic memory and self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.724861Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:3bb6857c029a1f9ec279e3cf0a43ae788a7cb4a4095974eda41eabd45e0cce78","observation_id":"84308df0-181e-4cb6-80f7-551a42aec180","resolution":{"observed_at":"2026-08-15T17:35:04.724861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.790","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:04.856996Z","title":"Tools fail: Detecting silent errors in faulty tools","venue":null,"work_id":"50c3359f-2b73-4983-817d-931e54359971","year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.730123Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:6812de16e72dc8abbf05338b0e5ff88a3cad801fe944ba7b4385ea27227a3442","observation_id":"f528b36d-0afc-4384-b1c0-811c75bf4ceb","resolution":{"observed_at":"2026-08-15T17:35:04.865552Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12253","last_updated":"2024-12-10T18:19:29Z","snapshot_observed_at":"2026-08-16T13:59:43.512059Z","submitted_at":"2024-04-18T15:21:34Z","title":"Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12253","snapshot_observed_at":"2026-08-15T17:35:04.735848Z","title":"Toward self-improvement of llms via imagination, searching, and criticizing, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.735848Z"},"links":{"cited_paper":"/paper/2404.12253","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:9245972e2811a98753f46120ff21ea47e572e46da34b7e6b6438c71ef0c29831","observation_id":"2c27f36c-6b43-464e-93d1-8c4bf7c1001d","resolution":{"observed_at":"2026-08-15T17:35:04.735848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09682","last_updated":"2025-02-22T22:31:33Z","snapshot_observed_at":"2026-08-16T14:42:46.909713Z","submitted_at":"2023-11-16T08:52:27Z","title":"MacGyver: Are Large Language Models Creative Problem Solvers?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09682","snapshot_observed_at":"2026-08-15T17:35:04.741789Z","title":"Griffiths, and Faeze Brahman","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.741789Z"},"links":{"cited_paper":"/paper/2311.09682","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:08afbba40dbbf5eb5e2762ec661b661518c51b222c031be338179889caeafd3c","observation_id":"77161aab-ed0a-49f5-b8e1-51fb9c144aba","resolution":{"observed_at":"2026-08-15T17:35:04.741789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18901","last_updated":"2024-07-26T17:55:45Z","snapshot_observed_at":"2026-08-16T13:30:42.217868Z","submitted_at":"2024-07-26T17:55:45Z","title":"AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18901","snapshot_observed_at":"2026-08-15T17:35:04.748315Z","title":"AppWorld: a controllable world of apps and people for benchmarking interactive coding agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.748315Z"},"links":{"cited_paper":"/paper/2407.18901","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:c2ed82a6279de824a9cf47846c5d1e9f2ef3fa4fdc6da36a8e3093d815d0c478","observation_id":"b4a7301e-ab49-4020-b33b-caf333fbfc26","resolution":{"observed_at":"2026-08-15T17:35:04.748315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04746","last_updated":"2024-03-07T18:50:51Z","snapshot_observed_at":"2026-08-16T14:11:51.304044Z","submitted_at":"2024-03-07T18:50:51Z","title":"LLMs in the Imaginarium: Tool Learning through Simulated Trial and Error","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04746","snapshot_observed_at":"2026-08-15T17:35:04.755171Z","title":"Llms in the imaginarium: tool learning through simulated trial and error","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.755171Z"},"links":{"cited_paper":"/paper/2403.04746","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:c8df864242f7c335a5deca8113e160d08a4162b662e4135018bc41738a65177c","observation_id":"4c2c4c0f-7dbe-4066-a0c0-40a413774888","resolution":{"observed_at":"2026-08-15T17:35:04.755171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01030","last_updated":"2024-06-07T01:53:07Z","snapshot_observed_at":"2026-08-16T14:22:20.166702Z","submitted_at":"2024-02-01T21:38:58Z","title":"Executable Code Actions Elicit Better LLM Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01030","snapshot_observed_at":"2026-08-15T17:35:04.761224Z","title":"Executable code actions elicit better llm agents, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.761224Z"},"links":{"cited_paper":"/paper/2402.01030","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:f4cd486560579a9d0e1466ed1778d799dcb2fd222fded0712155260222721509","observation_id":"af94b5a2-a022-406d-ab01-2f71680bf1b8","resolution":{"observed_at":"2026-08-15T17:35:04.761224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:05.891212Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":"f21b4177-c45a-4974-9ff6-badd856d5405","year":2022},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.766498Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:df8196a55fcfcdb1d71a9ed22304fac0df7bfd088df303245b446446cdb7eab6","observation_id":"fc266d72-cba0-415a-8b7c-d31c58da90c9","resolution":{"observed_at":"2026-08-15T17:35:05.896423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01622","last_updated":"2024-10-23T15:02:57Z","snapshot_observed_at":"2026-08-16T14:22:02.195673Z","submitted_at":"2024-02-02T18:39:51Z","title":"TravelPlanner: A Benchmark for Real-World Planning with Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01622","snapshot_observed_at":"2026-08-15T17:35:04.771353Z","title":"Travelplanner: A benchmark for real-world planning with language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.771353Z"},"links":{"cited_paper":"/paper/2402.01622","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:5f4193c11bf7c02de2d9862a5ce976cffc6a8e6db14aa306dbd99daf5d2c84f2","observation_id":"cd00d879-5d49-41dd-a89f-20c9d2c3469d","resolution":{"observed_at":"2026-08-15T17:35:04.771353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18752","last_updated":"2023-05-30T05:27:21Z","snapshot_observed_at":"2026-08-16T18:38:00.972721Z","submitted_at":"2023-05-30T05:27:21Z","title":"GPT4Tools: Teaching Large Language Model to Use Tools via Self-instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18752","snapshot_observed_at":"2026-08-15T17:35:04.776568Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.776568Z"},"links":{"cited_paper":"/paper/2305.18752","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:9a4f1493a6f2986a35f49054e4279d9c74c483e0f3c2c61e81cd53bc78590613","observation_id":"f02a91bc-171e-46bf-b8d6-73b96e307186","resolution":{"observed_at":"2026-08-15T17:35:04.776568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:05.873890Z","title":"Narasimhan, and Yuan Cao","venue":null,"work_id":"619bac0a-c1cd-4e9b-95e8-e24dcb77cdc0","year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.781665Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:0852d318fde265031c7a631fee20ad167db9f9d879d988de4871dce764b4e7e6","observation_id":"325dcc46-6bb2-40a4-9651-aa78fd779d91","resolution":{"observed_at":"2026-08-15T17:35:05.879324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02506","last_updated":"2025-05-20T14:15:36Z","snapshot_observed_at":"2026-08-16T12:59:41.102133Z","submitted_at":"2025-01-05T11:06:55Z","title":"ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02506","snapshot_observed_at":"2026-08-15T17:35:04.786251Z","title":"Toolhop: A query-driven benchmark for evaluating large language models in multi-hop tool use, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.786251Z"},"links":{"cited_paper":"/paper/2501.02506","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:294f6f634dc16711f8038e2cd2090a792a83da0cf4434e9c9062dfca732cd0dd","observation_id":"293a55cf-fdbe-48fc-b32b-0eaef57149e1","resolution":{"observed_at":"2026-08-15T17:35:04.786251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:04.791562Z","title":"S pider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to- SQL task","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.791562Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:d2b2011803ae9fec9036ae50446760c93ae4e11693b0ab2196f393b6a3ce74e5","observation_id":"10fb510f-3660-4539-9db2-1b87d62a0fa0","resolution":{"observed_at":"2026-08-15T17:35:04.791562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T17:35:04.797558Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.797558Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:642ae227dba32bbbc3a5e0538d7b3f48e99464e2ddd24e624c15b397c64bd243","observation_id":"80662e47-dfbc-4851-ab83-11f7d49bc0e2","resolution":{"observed_at":"2026-08-15T17:35:04.797558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:05.845254Z","title":"Toolqa: A dataset for llm question answering with external tools","venue":null,"work_id":"ee1d5198-8e15-4127-a57b-578c20229597","year":2023},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.802632Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:c47a5e43a560128970c0f9bafa19c64b59e4b14eed00bf6abe2e75c746c710ca","observation_id":"50ac5ae7-4539-48fc-b1e4-a38fd99ade02","resolution":{"observed_at":"2026-08-15T17:35:05.850841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:04.807665Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.807665Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:9d26994183357a3e8b1e238e61f9071358cadae5fa581494e9c6721fc391729c","observation_id":"37e372b8-237a-4c2d-917b-61c9b90ac51a","resolution":{"observed_at":"2026-08-15T17:35:04.807665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:04.813952Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.813952Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:f8eacdced1b34da8d19b55a3f23dcd196026931173deb6e649bb0fa55c334ea3","observation_id":"697dbf48-d41e-4789-a822-439c811d3938","resolution":{"observed_at":"2026-08-15T17:35:04.813952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:35:04.819123Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:35:04.819123Z"},"links":{"citing_paper":"/paper/2508.11027"},"observation_digest":"sha256:528d0d43e2c83b8a7d8b2a1a96bfa0cdba2da8c2592494742d9ff1f95f4d532c","observation_id":"f6373f42-2c47-40e5-88fd-03d49e3b9023","resolution":{"observed_at":"2026-08-15T17:35:04.819123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.11027","last_updated":"2025-08-14T19:21:09Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T17:26:41.076470Z","submitted_at":"2025-08-14T19:21:09Z","title":"Hell or High Water: Evaluating Agentic Recovery from External Failures"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 3 inbound Pith citation observations for arXiv:2508.11027."}