{"as_of":"2026-08-09T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15dcffbb6d3a64e77ea3530754bfbac32cd8dff2d276e5847a152d3a84f9f3d6","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T15:12:56.011712Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:17:57.244743Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04686","snapshot_observed_at":"2026-08-03T12:17:57.244743Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29175","last_updated":"2026-07-31T08:52:26Z","snapshot_observed_at":"2026-08-08T15:28:27.209674Z","submitted_at":"2026-07-31T08:52:26Z","title":"Execution-First Synthetic Tool-Use Trace Generation for LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T12:17:57.244743Z"},"links":{"cited_paper":"/paper/2607.04686","citing_paper":"/paper/2607.29175"},"observation_digest":"sha256:28748970276d2d786d5f0daeecb54b62b6c4c06459e849758dd45f043cd0080b","observation_id":"8cf90e24-efa5-44e8-b18a-510e7b202ea8","resolution":{"observed_at":"2026-08-03T12:17:57.244743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.04686/citation-record","integrity":"/paper/2607.04686/integrity","json":"/paper/2607.04686/citation-record.json","paper":"/paper/2607.04686"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"arXiv preprint arXiv:2302.04761 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:1ab75610bdab1a1450f60b3c85ebf851c0429839f32a0714d699c5b7560c191b","observation_id":"c177f1e6-aebb-4075-a9ff-b8027fe6ad5a","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"and Mao, Huanzhi and Yan, Fanjia and Ji, Charlie Cheng-Jie and Suresh, Vishnu and Stoica, Ion and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:1b3f65d248a73d16281bfb98bb228608159cf4d40df75c8ab46d727f47f874c5","observation_id":"f6b09d4a-eaa3-46ca-a215-3baaf5d0cc6e","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"arXiv preprint arXiv:2406.12045 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:6f28fd140c85a8937714269594138eaf8edc268dc7e34a70bf39daa0f913d3c6","observation_id":"12d4ccb2-8da2-4fe4-a265-1a91a2e9e564","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"and Zhang, Tianjun and Wang, Xin and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:bad749d3d136f31362669f6aed883fe6b828e8f3b3b152053bc85aa397dbfd59","observation_id":"ca915570-62d2-4023-af1f-a6c894a85d2a","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"arXiv preprint arXiv:2510.25726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:bea95610d23a1927228abd6937dd8bf844df83fd454d5468723a51064575d8b2","observation_id":"060e3252-148b-4833-a3b1-498b8d40fafa","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:341dfcc5f702f3cccfd6121bc2e7cfdfa1ae7bcb55cf54b0ae6c6bf9b8b69644","observation_id":"826f14f1-aef0-482e-a628-34322ec0898e","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"and Yang, John and Wettig, Alexander and Yao, Shunyu and Pei, Kexin and Press, Ofir and Narasimhan, Karthik R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:64b459cf8fd06f46b508c045efe92dc84c9e0c75dd49d73c147f4b483206fcec","observation_id":"e29d4aa5-6c83-4e9f-b6e2-71d7cd41a76e","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"Finance Agent Benchmark: Benchmarking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:b73444cd0a6437070a2aa9a80dd3c90ee47b3e98f0efd11580fe2a6beb5e4a21","observation_id":"ef74a8bc-1374-47d0-8009-81748a74fd5c","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"and Geng, Gloria and Park, Danny and Zou, James and Ng, Andrew Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:bbce823ae02b53fb03c35b8fef1090a413b24aab3702c3956ad504229229c49b","observation_id":"49247251-c6a0-42a8-ac97-9bde6001162e","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:4578d6cac114b5c32da070eaf77e47ae7fb656525564e72a944917e876e4cc3d","observation_id":"edfc4b52-4ff0-4077-a3f7-26d8fd4fe7b9","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:270b2800a293b067aa6674865c68702ab2eb23243e1b5657669c42ff38a88408","observation_id":"e88112ad-b5a4-47ae-bd65-4936f92ee39d","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:5942bd0c30ac363b2f3ccb7a691012f5f8889e993f017d561ae7b8780fd1005c","observation_id":"97e42aa2-bd0f-4e90-b072-10761943d95f","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:1e39efd1c8626ad7c921f2e58aa4a29e4644a4e58828d5d6c458d06c3971c307","observation_id":"7f0fd84c-a0f9-419f-a5a9-1255a973dfe0","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:0a21fecfc6a03b3827b9f7b033786119da4e3f17eebf596ed7287da68fe6de80","observation_id":"86f1a5b3-f13c-41d4-ac14-8ac71e09c9d1","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:5d8ebe44f4212cb0658c76f2a3e6ee1cd84dcd822b3afe7beaf07a2087a4d454","observation_id":"bed24dcb-306b-48c2-a850-51490f324a17","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"Educational and Psychological Measurement , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:71c903822c9c35227e76c2a9320cfcfe9276523fca8f3904662fe06a14913f97","observation_id":"9a1b86f5-ad7d-46b9-b450-bd93d7be622d","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"Psychological Bulletin , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:2351281f8c0ec2812e5403023d4530da86c77f3c6ae99097586a1028dfe30c15","observation_id":"867c7751-3940-4ae1-a2de-96157fa811c2","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:581dea6ef10207bc3af513c5f32ac6beed107496bc09cd5ff3e085b1ce55ef3b","observation_id":"47fdd92f-e3d1-44d5-87f1-94dc9c1fae40","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:59c3f726dbbceb4ddf459abf6b2fb7ef724b616d76b79cc1f911e84d9faeb022","observation_id":"3d112f79-2203-4d70-a548-42b5ffa4cbb5","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"and Zhang, Hao and Stoica, Ion , booktitle=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:1d552c21a71a1a50e0af2384f373c91e9c7890a7545070fce6ceddb124a33e0d","observation_id":"87137053-b27d-4fad-b167-b37a01310401","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2023 , url=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:6d99f58daba2ce70da6c82abd6179e0afcef5c5e48d9783433816a1558b4088a","observation_id":"1c065b3d-26d8-4c18-99ee-44b65c15f1dc","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2023 , url=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:ce9f71e7e6511f09812281fdbe087edad967e809d5731e4e24900b9fa375c470","observation_id":"96260572-bdae-4ce1-bb7b-16a8894f0708","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:50998f35b33b189910729e0457149cbca29b74766d95ddc5a08a1075a82e8796","observation_id":"28b440d5-65b8-4207-b4e6-cc2d36543edd","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:a1e777110b2557ad69901c5bed1f8de21e4e4e10b47747ce9a449bbb2428e815","observation_id":"d026d882-0cb0-4483-a110-44cd6461a724","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:88c0ba407f4ea73a94eb8a81fa2756385b0ee8a0fa90f8e0e17592c934094d8c","observation_id":"d7290a79-2880-4701-93f3-6bf85cb23364","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:0054a536466f1c82eaba5b6308aba505c743971c1322d84eff4d7180ea73ea3b","observation_id":"84796e9f-cb2f-4007-b60e-c663e031805a","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"2025 , month=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:ef41033ef3590554d105f4d88688abaf729371eff296706fb80a692518891df3","observation_id":"5c5d8569-33db-467b-a7ba-41b1d18e3079","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05201","last_updated":"2024-10-02T20:17:49Z","snapshot_observed_at":"2026-08-08T11:16:05.826242Z","submitted_at":"2024-02-07T19:11:23Z","title":"The Effect of Sampling Temperature on Problem Solving in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05201","snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"arXiv preprint arXiv:2402.05201 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"cited_paper":"/paper/2402.05201","citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:6c6b94ec8134c41b327ca4ba3541c2334a549620ebe449a856b52a7aea5990ef","observation_id":"5d817d2b-7384-40db-90b2-c7f697f193e6","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:12:56.011712Z","title":"The Good, The Bad, and The Greedy: Evaluation of","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-11T15:12:56.011712Z"},"links":{"citing_paper":"/paper/2607.04686"},"observation_digest":"sha256:6d52f8456312df95221d93677a06ad0bedacff7d4618ab6af9708bb39b2763e3","observation_id":"9f14c13c-6d39-44c9-b08d-16a6f6d2c51d","resolution":{"observed_at":"2026-07-11T15:12:56.011712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04686","last_updated":"2026-07-06T05:25:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T01:29:06.795860Z","submitted_at":"2026-07-06T05:25:21Z","title":"ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2607.04686."}