{"as_of":"2026-08-19T22:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e605efc76fe2dca030c337ccd070cd1f12f98725ec05f5f83adda2e9fdab056","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:25:00.076693Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27518/citation-record","integrity":"/paper/2607.27518/integrity","json":"/paper/2607.27518/citation-record.json","paper":"/paper/2607.27518"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-12T16:49:10.970507Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-01T06:24:58.623173Z","title":"MLE-bench: Evaluating machine learning agents on machine learning engineering.arXiv preprint arXiv:2410.07095,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.623173Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:e903004ce25e2b14a38a0841660721f1001af79026f78597823974dfd5c88e2f","observation_id":"43e11603-7f26-4f4f-afbb-59b226ee71f0","resolution":{"observed_at":"2026-08-01T06:24:58.623173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09563","last_updated":"2026-04-22T09:22:42Z","snapshot_observed_at":"2026-08-15T14:28:58.786959Z","submitted_at":"2026-02-13T21:35:45Z","title":"Seven simple steps for log analysis in AI systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09563","snapshot_observed_at":"2026-08-01T06:24:58.709724Z","title":"Seven simple steps for log analysis in AI systems.arXiv preprint arXiv:2604.09563,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.709724Z"},"links":{"cited_paper":"/paper/2604.09563","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:10238a51e7bf46512c8b55441b6d1c0903dc72b085b8b15592ce87bf1ef137d4","observation_id":"ba71c2e3-2283-457c-ab5a-d02ceb5ff26f","resolution":{"observed_at":"2026-08-01T06:24:58.709724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:24:58.795365Z","title":"Measuring AI agents’ progress on multi-step cyber attack scenarios.arXiv preprint arXiv:2603.11214,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.795365Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:322ccb79626df6e7e1419af14215399dc61a696433c843996f973627ab6f0ac4","observation_id":"6627a295-fbbe-4c4e-b302-db9fccb0b6bb","resolution":{"observed_at":"2026-08-01T06:24:58.795365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:24:58.886679Z","title":"Sayash Kapoor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.886679Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:78318b65db76db4ca8ac7bc3655cda46c49b61b2171c69ec971cabb051d3ea39","observation_id":"51a99686-3a9b-4f65-b9fa-34da2d4abaa7","resolution":{"observed_at":"2026-08-01T06:24:58.886679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-01T06:24:59.053330Z","title":"Merrill, Alexander G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.053330Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:3595ea5ca7702356f04b59e9eec2277c9f297dce5ed288cf63d45fc7a68b8d3a","observation_id":"e7088df3-e805-46ef-8379-0e1d7896948d","resolution":{"observed_at":"2026-08-01T06:24:59.053330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10517","last_updated":"2025-02-14T19:30:53Z","snapshot_observed_at":"2026-08-16T10:36:49.395324Z","submitted_at":"2025-02-14T19:30:53Z","title":"KernelBench: Can LLMs Write Efficient GPU Kernels?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10517","snapshot_observed_at":"2026-08-01T06:24:59.127654Z","title":"Zhang, William Hu, Christopher Ré, and Azalia Mirho- seini","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.127654Z"},"links":{"cited_paper":"/paper/2502.10517","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:d08255d89d8050aa0294a1d59e1907eb500c5097304d704bd35f8c1bf57d6f5a","observation_id":"505b22e1-49f5-48b5-9e56-cafd480d89e8","resolution":{"observed_at":"2026-08-01T06:24:59.127654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-01T06:24:59.202308Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.202308Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:974eed78b582a96a53b927d986795fec2a4309a73518ac1090346ab0c2b38a8b","observation_id":"7bfc0b18-c56c-42b3-ad83-053913b0618a","resolution":{"observed_at":"2026-08-01T06:24:59.202308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:24:59.266458Z","title":"PostTrainBench: CanLLMagentsautomateLLMpost-training?arXiv preprint arXiv:2603.08640,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.266458Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:60fdc37c5253f4f010953d3f766d34cfa3a64d1603a194f76366914607e5b732","observation_id":"37882ef8-f420-4dbd-af7c-29969ea7c76e","resolution":{"observed_at":"2026-08-01T06:24:59.266458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-01T06:24:59.336807Z","title":"Ayrton San Joaquin, Rokas Gipiškis, and Ze Shen Chin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.336807Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:07c9cd87217c9ec661b215f8ac1f8e29a82e5a9b6d16bfa9ac5c8147d65170a5","observation_id":"3c739425-967f-4349-a8a0-56f03299ffe2","resolution":{"observed_at":"2026-08-01T06:24:59.336807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:24:59.409558Z","title":"Zachary S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.409558Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:821ca10a285651ea21e878672005b877d9ade3386f56991799312b4c928c59d8","observation_id":"5332bbed-fc19-4654-9342-38f9907a4c5a","resolution":{"observed_at":"2026-08-01T06:24:59.409558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11363","last_updated":"2026-06-22T22:36:12Z","snapshot_observed_at":"2026-08-16T13:17:45.152269Z","submitted_at":"2024-09-17T17:13:19Z","title":"CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11363","snapshot_observed_at":"2026-08-01T06:24:59.489925Z","title":"URLhttps://arxiv.org/abs/ 2409.11363","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.489925Z"},"links":{"cited_paper":"/paper/2409.11363","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:786b37d0c3474442a9b35bffa0939364dc832a46cc60a166c908f5bcdb52405b","observation_id":"8f278a99-1448-4012-a90e-41ba1e0aee7c","resolution":{"observed_at":"2026-08-01T06:24:59.489925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24955","last_updated":"2026-04-27T19:51:25Z","snapshot_observed_at":"2026-08-12T21:28:01.812141Z","submitted_at":"2026-04-27T19:51:25Z","title":"BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24955","snapshot_observed_at":"2026-08-01T06:24:59.579784Z","title":"Bench- Guard: Who guards the benchmarks? automated auditing of LLM agent benchmarks.arXiv preprint arXiv:2604.24955,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.579784Z"},"links":{"cited_paper":"/paper/2604.24955","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:1ce4794c49219c0fe90d1ab5ee89c6316c8c587bd629725a92946d173065c570","observation_id":"232bb22d-d1e1-423c-958b-43a7223beb6b","resolution":{"observed_at":"2026-08-01T06:24:59.579784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26079","last_updated":"2026-05-26T06:39:24Z","snapshot_observed_at":"2026-08-05T22:04:26.292185Z","submitted_at":"2026-05-25T17:44:21Z","title":"Automated Benchmark Auditing for AI Agents and Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26079","snapshot_observed_at":"2026-08-01T06:24:59.673010Z","title":"AutomatedbenchmarkauditingforAIagentsandlargelanguagemodels.arXiv preprint arXiv:2605.26079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.673010Z"},"links":{"cited_paper":"/paper/2605.26079","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:4022fe3d02094bf7062e94bbf0de7a966a30cfe377ea932f2ecbf2c0e8158475","observation_id":"c5a6f6b5-3bd7-4527-8feb-e3baa75a3d7e","resolution":{"observed_at":"2026-08-01T06:24:59.673010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:24:59.745650Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.745650Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:322e86b8040e28f5ddef6be2d2392cc573e61d994d3ec26d1dbbe1ddade7dc25","observation_id":"98176a1b-d30a-473d-84b3-eb363626bb36","resolution":{"observed_at":"2026-08-01T06:24:59.745650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-17T22:49:53.742436Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02825","snapshot_observed_at":"2026-08-01T06:24:59.912539Z","title":"Content-Type: application/json","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.912539Z"},"links":{"cited_paper":"/paper/2507.02825","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:375fb7fe37eb21f909e21883093a2f4549d70dba1df17716461981095c286a67","observation_id":"df392865-68cb-4dc7-9285-56fc59986a67","resolution":{"observed_at":"2026-08-01T06:24:59.912539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:24:59.995156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.995156Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:8d83421a92f3f738a02cd8bc0c73da52ad2e5a4eccc066bdb8dba58277591a14","observation_id":"57a2c2a5-dab5-4a94-92ab-b33de042f2dc","resolution":{"observed_at":"2026-08-01T06:24:59.995156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:25:00.076693Z","title":"write to /app/out.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T06:25:00.076693Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:92673a8b7ba18954ce508489abde9328cc0f7db38f9d8f0f7614af9b44641f32","observation_id":"6fcf916a-ec3f-4aeb-bb44-7d465402a2ee","resolution":{"observed_at":"2026-08-01T06:25:00.076693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-01T06:24:59.835059Z","title":"URL https://arxiv.org/abs/1905.07830","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:59.835059Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:09d73b9a07af6ce88b83c95b359667c1967c6c6bf19bd659fe47ebfc6887e941","observation_id":"bf6fa028-3ef7-4606-80dc-77685dfdbf4d","resolution":{"observed_at":"2026-08-01T06:24:59.835059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-01T06:24:58.973480Z","title":"URLhttps://arxiv.org/abs/2109.07958","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.973480Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:7b81220dfd27309257024b8571cdbfc205892260386f05c6099023a3695cfa44","observation_id":"fa861514-1852-499f-9692-3cfa92d50724","resolution":{"observed_at":"2026-08-01T06:24:58.973480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:24:58.541183Z","title":"Kao, Evangelia Spiliopoulou, and Adina Williams","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.541183Z"},"links":{"citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:b92b13ee48ce30281be2dfb44c795c4f1f4051c3de057386216483b363d1dca5","observation_id":"5f0e2ef3-8c23-4cea-a165-92b98e898a93","resolution":{"observed_at":"2026-08-01T06:24:58.541183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07440","last_updated":"2024-09-11T17:37:48Z","snapshot_observed_at":"2026-08-16T13:19:22.649987Z","submitted_at":"2024-09-11T17:37:48Z","title":"SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07440","snapshot_observed_at":"2026-08-01T06:24:58.454362Z","title":"SUPER: Evaluating agents on setting up and executing tasks from research repositories","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.454362Z"},"links":{"cited_paper":"/paper/2409.07440","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:9aa6ed2355472e659e25180eb08b7f90d789f5a97c7acaae649b5284f878f012","observation_id":"7d7df7e5-3904-428d-a5f8-0c65f2366e4e","resolution":{"observed_at":"2026-08-01T06:24:58.454362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-01T06:24:58.374494Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T06:24:58.374494Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.27518"},"observation_digest":"sha256:3af0c54a53d7e71c4eab773f339cd0231777422a9ea43dc6290b87a0a3f808e5","observation_id":"048ba888-a8b2-4d5c-b8f5-12df41a89cb9","resolution":{"observed_at":"2026-08-01T06:24:58.374494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27518","last_updated":"2026-07-29T23:17:08Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T10:56:41.548668Z","submitted_at":"2026-07-29T23:17:08Z","title":"Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2607.27518."}