{"as_of":"2026-08-15T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:daca2133afb6d2fe0a3f7aba008c0c9f0458534db2e3b3f798321c4a109017e5","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:01:51.733338Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:04:24.401637Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09863","snapshot_observed_at":"2026-07-14T07:06:37.817238Z","title":"arXiv preprint arXiv:2606.09863 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11098","last_updated":"2026-07-15T06:22:24Z","snapshot_observed_at":"2026-08-14T12:33:48.435405Z","submitted_at":"2026-07-13T05:14:12Z","title":"AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T07:06:37.817238Z"},"links":{"cited_paper":"/paper/2606.09863","citing_paper":"/paper/2607.11098"},"observation_digest":"sha256:3fb01da6bf20dc766899149cfe92d96b797644d13c99fc249f05a9912aef966d","observation_id":"12b1c7bc-af30-4d0e-802b-c9d11dafc8cc","resolution":{"observed_at":"2026-07-14T07:06:37.817238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09863","snapshot_observed_at":"2026-08-02T07:04:24.401637Z","title":"arXiv preprint arXiv:2606.09863 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11098","last_updated":"2026-07-15T06:22:24Z","snapshot_observed_at":"2026-08-14T12:33:48.435405Z","submitted_at":"2026-07-13T05:14:12Z","title":"AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T07:04:24.401637Z"},"links":{"cited_paper":"/paper/2606.09863","citing_paper":"/paper/2607.11098"},"observation_digest":"sha256:70043db3db00bceb1a7a960b04590b6ba19946b27570291738fe232ade4f78bb","observation_id":"73f849e8-ce67-4df3-a03b-c6d59193c50f","resolution":{"observed_at":"2026-08-02T07:04:24.401637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09863","snapshot_observed_at":"2026-07-31T00:05:59.121624Z","title":"From Confident Closing to Silent Failure: Characterizing False Suc - cess in LLM Agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-03T20:51:37.077654Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.121624Z"},"links":{"cited_paper":"/paper/2606.09863","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:6cd9cb8eec836397e0b8e58a84506af41ecc3366181a61a5bc298773f583fe69","observation_id":"ba35ee0c-a4db-435c-9a67-67491996ea4a","resolution":{"observed_at":"2026-07-31T00:05:59.121624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.09863/citation-record","integrity":"/paper/2606.09863/integrity","json":"/paper/2606.09863/citation-record.json","paper":"/paper/2606.09863"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:f39b338fa6c6a9878635ae4e44eff6db708eea09342e84f0e058118c0b4d3fec","observation_id":"b37cb120-f2a6-4463-8201-2a28f3921719","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:cee556196af5e77058495aca3b6b1ff2c4b38e47c6cd640041ec6b1d43ec0fad","observation_id":"9a6d1927-6029-4ac4-b55d-7d4f635c9424","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-14T14:24:18.501413Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:72d2cf1fb3bc58c20dc635de0d7c855613af6dc8e0b2deb0788ef5d9206209a3","observation_id":"44cb9204-69fc-46d7-957c-832fc5f1e5f9","resolution":{"observed_at":"2026-07-01T21:56:15.786547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:58bf29f09d4c705d4b26814631b581c9aa3bb2a791d7190e28d921a745c177fa","observation_id":"dc417445-fbdc-4db9-a818-19ec4b53ba39","resolution":{"observed_at":"2026-07-01T21:56:15.789210Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:59:57.839780Z","title":"(2025) SABER: Small actions, big errors– safeguarding mutating steps in LLM agents","venue":null,"work_id":"f17f8ada-315d-4b1f-aef5-874a060e4209","year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:707a2ff672a26b6b305fb6cd86f4c8b36fac8787bc9417951cf6da2e9bbf5e8a","observation_id":"4dfc4506-c6e8-43a0-b1fa-cc6eef5c5504","resolution":{"observed_at":"2026-07-01T21:56:15.779500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.850","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Appworld: A controllable world of apps and people for benchmarking interactive coding agents","venue":null,"work_id":"49bc5dc9-cd09-4c9e-8aea-a0b3f3f6c167","year":2024},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:85f06ad26002da20fbc92fc5115b983e3866ae10a1213017abc93751f9d6745e","observation_id":"d113c81c-5328-45f1-add1-82714ce5ac0d","resolution":{"observed_at":"2026-06-28T16:02:21.506005Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T01:08:06.859256+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T01:08:06.859256+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"Which Agent Causes Task Failures and When? On Automated Failure Attribution of","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:1df6879769257a784df9c86519bed3c4195378591a447eb125bb0944017447ef","observation_id":"ea5bfbe4-e08b-4d3a-91e5-49811061bf0c","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03312","last_updated":"2025-09-04T17:49:20Z","snapshot_observed_at":"2026-08-15T10:10:27.283963Z","submitted_at":"2025-09-03T13:42:14Z","title":"AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?","version":2},"cited_work":{"arxiv_id":"2509.03312","doi":"10.48550/arxiv.2509.03312","metadata_source":"pith","pith_arxiv_id":"2509.03312","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhang, J","venue":"cs.CL","work_id":"bcc7b37c-db67-4d9b-8cc2-9458cc338abd","year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"cited_paper":"/paper/2509.03312","citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:a78fd6b64fedaec00781e5b910704e705271097d063f0b224f91e74ef892c7c4","observation_id":"bf71e865-1a8d-4fb1-b134-cdd774c863e8","resolution":{"observed_at":"2026-07-01T21:56:15.783080Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:55.524505+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:55.524505+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25370","doi":"10.48550/arxiv.2509.25370","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"verbose database queries correlate with null results","venue":"arXiv (Cornell University)","work_id":"f5d9bb38-d94c-48e1-81b3-06c3398e72d1","year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:b23f386ae9e6c19c265cd6d3c0fe18d6318520bb148143fe50c9f90c87d8bdf1","observation_id":"c513626a-bae3-4f38-a8c0-9c020f48857d","resolution":{"observed_at":"2026-07-01T21:56:15.792020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:55.99496+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:55.99496+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:12e4ba623c133f67f6176801f27c9ad0cb04f5e2238bedf3270762c249cf5581","observation_id":"dd14717c-c19e-41ab-8df4-2a77e01092e5","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:79917e853a5c11a66ab3f6480299113fabc97b369a17623d4e6afe0e22bfd136","observation_id":"d3c9d3a1-044f-47cc-9d0c-364d98d06f9c","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"Length-Controlled","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:fff1b5f7b3120d2ac7cf4c6dce670525aeacf8b0ea13e1d0e0c2928bc7d80f73","observation_id":"2ff36383-f662-47f2-aa04-cc35edd2eca7","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"Proceedings of the 42nd International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:ac318cafc08be3bff38d6d7e6664637c84526c1cc84d3a7fee2790b3f44e3b43","observation_id":"d782e89c-a885-49b1-8d37-50e1f4d55c0a","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:74580ea5dbc42e72bcda870c26d5e994543ea30ba5ceaa365cda155908ce8448","observation_id":"d995c0df-3a9c-4478-8689-5ecbd65992c4","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:43.039081Z","title":"Beyond task completion: Revealing corrupt success in LLM agents through procedure-aware evaluation","venue":null,"work_id":"1827c2b2-960e-4554-825e-b26fb4f8ca26","year":2026},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:d21d3ba8fc521119331c1bf57dc24df99b3786c0df6fe2384f2df48038202b0a","observation_id":"a716ce24-77b3-40f9-bebb-cdb82cbe4560","resolution":{"observed_at":"2026-07-01T21:56:15.794729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.847","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T00:44:06.790973Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":"Findings of the Association for Computational Linguistics: ACL 2023","work_id":"14e488cd-6766-46f9-8d82-99f460765fc6","year":2023},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:648462db55b993c5d7d136f5ac055bd1747bf1dbdc9d9fc28aee7d554d788782","observation_id":"dc1082c0-a23f-4d9b-bf4f-f510ec6b7f8f","resolution":{"observed_at":"2026-06-28T16:02:21.496658Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:14.319341+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:14.319341+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/coli.a.16","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Siren’s Song in the AI Ocean: A Survey on Hallucination in Large Language Models","venue":"Computational Linguistics","work_id":"c1f9fd16-e529-4eec-8384-abb4fa843185","year":2025},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:b2a676f62a4049d2818c742ca654a7620934bae6dddaf7b76bd85a6235a607ea","observation_id":"c10b3edf-9052-4f47-b7f9-4ca2e7c1544f","resolution":{"observed_at":"2026-06-28T16:02:21.501932Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T04:38:12.546169+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T04:38:12.546169+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:01:51.733338Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T16:01:51.733338Z"},"links":{"citing_paper":"/paper/2606.09863"},"observation_digest":"sha256:8915e9d32aa853c7a2c664f915033c90a69335d6a083fee4dfc239b02f618eb1","observation_id":"5bff2187-3801-4875-a303-7467ef04bc73","resolution":{"observed_at":"2026-06-28T16:01:51.733338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T16:58:28.221575Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":9,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 3 inbound Pith citation observations for arXiv:2606.09863."}