{"as_of":"2026-08-10T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d98c24afde5c02300d36f811bd92e57b7941a0a0fd9ea103666e75c55b9bba38","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:52:48.176696Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07346/citation-record","integrity":"/paper/2608.07346/integrity","json":"/paper/2608.07346/citation-record.json","paper":"/paper/2608.07346"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T05:52:48.085855Z","title":"Mark Chen, Jerry Tworek, Heewoo Jun, Qiming Yuan, Henrique Ponde De Oliveira Pinto, Jared Kaplan, Harri Edwards, Yuri Burda, Nicholas Joseph, Greg Brockman, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.085855Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:5ed27e3ccae586d6955bb0c25af8066d9804c0a442ef47d678094d26d1657136","observation_id":"5625cc56-5b20-443e-bde5-a3cc049f14d4","resolution":{"observed_at":"2026-08-10T05:52:48.085855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-10T05:52:48.098487Z","title":"Swe-bench pro: Can ai agents solve long-horizon software engineering tasks?arXiv preprint arXiv:2509.16941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.098487Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:fd4c029dbaf4dc43f410bda828b9db98ace351c035e986f16a59a260fef9a663","observation_id":"1a54921d-cc84-44e7-8ee1-3c99ee4bfb3d","resolution":{"observed_at":"2026-08-10T05:52:48.098487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18241","last_updated":"2024-11-27T11:29:17Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T11:29:17Z","title":"Exploration of LLM Multi-Agent Application Implementation Based on LangGraph+CrewAI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18241","snapshot_observed_at":"2026-08-10T05:52:48.102698Z","title":"Exploration of llm multi-agent application implementation based on langgraph+ crewai.arXiv preprint arXiv:2411.18241,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.102698Z"},"links":{"cited_paper":"/paper/2411.18241","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:19abe1a6c5ee5333ac727295436df141ff26ecb69dd635159b5bb3e269dd6913","observation_id":"db198a5b-35bc-4d38-a853-3cf7de2b12b1","resolution":{"observed_at":"2026-08-10T05:52:48.102698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.535768Z","title":"AgentQuest: A modular benchmark framework to measure progress and improve LLM agents","venue":null,"work_id":"d8d08dd8-5c8f-4ea5-8242-d4068b0d28e2","year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.105912Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:56c2f50b35a97cedf87c26a5a599512fa9c2007f702638816c7731713c63ead1","observation_id":"3eb138b2-b36f-4c69-8065-0659313dbba7","resolution":{"observed_at":"2026-08-10T05:52:48.539262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.108994Z","title":"doi: 10.18653/v1/ 2024.naacl-demo.19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.108994Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:7a0f6396c54a156460e60e8534da1c1428ca788462b39822f6e7cab0ba75d2f9","observation_id":"65bdc42a-287d-4d87-bf08-93c141cd6b4b","resolution":{"observed_at":"2026-08-10T05:52:48.108994Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T05:52:48.112150Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.112150Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:367dc8f0e9290aed5bb42419036b00ca77880501a8fb54c6d897e5dd2cb92330","observation_id":"04d89948-296e-4634-a31b-577117c37761","resolution":{"observed_at":"2026-08-10T05:52:48.112150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.122129Z","title":"Percy Liang, Rishi Bommasani, Tony Lee, Dimitris Tsipras, Dilara Soylu, Michihiro Yasunaga, Yian Zhang, Deepak Narayanan, Yuhuai Wu, Ananya Kumar, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.122129Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:611a07897014dbfa6b9afa026f13b523d73fcda15bee771b46b22b35b9d14fb5","observation_id":"408085aa-2f01-4960-bb53-84efac2b1c56","resolution":{"observed_at":"2026-08-10T05:52:48.122129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.128965Z","title":"URL https://proceedings.neurips.cc/paper_files/paper/2024/hash/ 877b40688e330a0e2a3fc24084208dfa-Abstract-Datasets_and_Benchmarks_Track.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.128965Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:87ee872a3ba8d581f187733d4f7c2b96f2113e743ca7d0e0c76cd923c226f4d4","observation_id":"3817d661-2696-4aea-93b4-b902cef122b0","resolution":{"observed_at":"2026-08-10T05:52:48.128965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-10T05:52:48.136857Z","title":"Todor Mihaylov, Peter Clark, Tushar Khot, and Ashish Sabharwal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.136857Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:3e75ceb1f08ac1102c2957f3b1deaff72970c7bbec3114edf22190435db2b810","observation_id":"d5c090e1-e6ea-44b7-b0d9-017520822c2a","resolution":{"observed_at":"2026-08-10T05:52:48.136857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-10T05:52:48.144277Z","title":"Sidharth Pulipaka, Oliver Chen, Manas Sharma, Taaha S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.144277Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:f7b5a6e1a7f67987a4374919b748e08fa81ff46c5440522e7d050526564ab02e","observation_id":"f3c75470-fc93-44e4-9e36-be13b64de80c","resolution":{"observed_at":"2026-08-10T05:52:48.144277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-10T05:52:48.147679Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.147679Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:cbe886304af81f6d4bc699013e8bf229a4e9f6fc7c0f9174b577536284a4c9ec","observation_id":"139e6e5a-fff7-4f4d-87e6-4455a1230951","resolution":{"observed_at":"2026-08-10T05:52:48.147679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.525297Z","title":"Challenging big-bench tasks and whether chain-of- thought can solve them","venue":null,"work_id":"ed7e0b2b-94d6-4811-84f5-50518d8a35c3","year":2023},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.154853Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:31fdd7f9a51f72f14ce0163f23ec2b05412e2e186c5827b708735f52be07a5c9","observation_id":"1b5f96d7-880a-4d91-b219-8ca16ce2a11f","resolution":{"observed_at":"2026-08-10T05:52:48.528742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.515171Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":"98ab77fa-8d60-4e10-83df-54c9e9c455eb","year":2019},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.158585Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:3fd9e81d14a5fe6e993245da738b26a9c10d72ee587ad86cfba487d7b2797aab","observation_id":"11cf1d65-33b9-46f8-8219-5cb159b44821","resolution":{"observed_at":"2026-08-10T05:52:48.518772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-10T05:52:48.161998Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.161998Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:ce9df4c46dd123891cdf0f425e48b48f97bcfb70d8ae6e1fd5c9bd786cb31b1c","observation_id":"dc862431-79e6-4274-bd6b-2e62e90a1f64","resolution":{"observed_at":"2026-08-10T05:52:48.161998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.165568Z","title":"URL https: //aclanthology.org/2025.acl-long.1355/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.165568Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:99a3bfb88426b1b7851b5b43947c468ba680aacb8051781ef06d814c610db967","observation_id":"29cd5a68-1edd-45f6-b352-5db9ba220843","resolution":{"observed_at":"2026-08-10T05:52:48.165568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-10T05:52:48.169156Z","title":"Matei Zaharia, Andrew Chen, Aaron Davidson, Ali Ghodsi, Sue Ann Hong, Andy Konwinski, Siddharth Murching, Tomas Nykodym, Paul Ogilvie, Mani Parkhe, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.169156Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:c3d1a3971cb81787b6ba6b21adbc00eec6c906d978d38c0de8f7fce33b5d3865","observation_id":"4cd9036f-7a42-413c-be52-d7ab72ab06a0","resolution":{"observed_at":"2026-08-10T05:52:48.169156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.504110Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":"0c79a092-7ba3-4bf5-9d2e-c1e7a22ed0f2","year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.173232Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:5ae2b15eace5284a2bae7c6738f45ea1daab4023936f0aba3fd8aeacd65d0611","observation_id":"967a22cf-b289-4992-9ea8-4cdfa8037e74","resolution":{"observed_at":"2026-08-10T05:52:48.507977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:52:48.493004Z","title":"Webarena: A realistic web environment for building autonomous agents","venue":null,"work_id":"efccaa4d-c01f-4707-a2bc-8fe9b4583c04","year":2024},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.176696Z"},"links":{"citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:ff7f1f31c4b666e3515852a9790bdc767859229409fbd7da5da9026d1716aa1b","observation_id":"1193309a-467b-4d65-9667-62c9f12175ac","resolution":{"observed_at":"2026-08-10T05:52:48.497017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T05:52:48.094149Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.094149Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:2dbf0c728ee7bf3892790fa993047fb34d1e844682659b0abc6f394b429ef775","observation_id":"539b6acb-6091-478a-b9be-ec9b3644bcb4","resolution":{"observed_at":"2026-08-10T05:52:48.094149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-10T05:52:48.115676Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.115676Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:42e1a4983d469819044e82e9d0ae7fa3fd5a7f4fdd9d9f1a991b8a83501a4b53","observation_id":"0348cd40-320d-423a-bdfc-bc61eea4c093","resolution":{"observed_at":"2026-08-10T05:52:48.115676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T05:52:48.089974Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.089974Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:7b8b5eacdbc220b0ecadae6ac7eea9167b2964d5448dbcaba9006d3711b97ee7","observation_id":"fc4b48c1-a2ab-40ad-b5d2-933213c61d98","resolution":{"observed_at":"2026-08-10T05:52:48.089974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-10T05:52:48.125316Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.125316Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:3915c5007e400f9cc8a167b02afc67251a8969e636932fca28ecb5b2289fb067","observation_id":"ed8b3f05-daae-4ebf-92d7-bf465ad0e3ba","resolution":{"observed_at":"2026-08-10T05:52:48.125316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04874","last_updated":"2026-06-05T05:23:52Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T13:37:47Z","title":"Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents","version":2},"cited_work":{"arxiv_id":"2606.04874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.04874","snapshot_observed_at":"2026-08-10T05:52:48.238137Z","title":"Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents","venue":"cs.CL","work_id":"f1cc9e10-38db-4c2b-b353-36e15c589768","year":2026},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.151220Z"},"links":{"cited_paper":"/paper/2606.04874","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:11711df2254bbb4e47405952c527f590b465e230b6fb814cc47e70cef64512b4","observation_id":"aaeede7f-642d-4d82-8cfc-e039574f507f","resolution":{"observed_at":"2026-08-10T05:52:48.244282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-10T05:52:48.081468Z","title":"Victor Barres, Ben Shi, Ola Zytek, Soham Ray, Keshav Dhandhania, and Pedram Razavi.τ 3-Bench: Advancing agent evaluation to knowledge and voice","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.081468Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:fa0d567b08320f93a47f64705ef59f2bfbe60a6dffa9deac457f26e7de25733f","observation_id":"a8fbcf01-2c69-4ddb-8a7a-dcadbdc527ce","resolution":{"observed_at":"2026-08-10T05:52:48.081468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22953","last_updated":"2026-05-11T10:27:38Z","snapshot_observed_at":"2026-08-10T09:42:09.423320Z","submitted_at":"2026-02-26T12:48:02Z","title":"General Agent Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22953","snapshot_observed_at":"2026-08-10T05:52:48.077579Z","title":"Presented at the ICLR 2026 Workshop on Agents in the Wild","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T05:52:48.077579Z"},"links":{"cited_paper":"/paper/2602.22953","citing_paper":"/paper/2608.07346"},"observation_digest":"sha256:8975e5adf62ccc9a1ba4c9665bbae116723632f70d9c170103476e9413cbe03a","observation_id":"f020150e-188f-4d8b-bf9e-c106e2db9075","resolution":{"observed_at":"2026-08-10T05:52:48.077579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07346","last_updated":"2026-08-07T15:44:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T17:13:12.813407Z","submitted_at":"2026-08-07T15:44:12Z","title":"An End-to-End Agent Auditing Engine"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.07346."}