{"as_of":"2026-08-11T18:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6350acea8290fcd693cd84b128e436d2e134bfb866d83e2410f12700ab0c77ea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":56,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:04:33.587373Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T18:37:31.168670Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-14T01:35:50.992477Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2410.09024"},"observation_digest":"sha256:e79b8e72d660206f859c5b0fe081f38fccc96e33837e55b68b9ab0fc1845f288","observation_id":"0feb9130-5989-413f-818a-86b3d31b83ba","resolution":{"observed_at":"2026-05-14T01:35:51.135418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-08-09T13:05:34.738390Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T14:22:01.616448Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2412.04984"},"observation_digest":"sha256:000242398128b6dc425e2fb2b27305842eb6002fa87fd1d8660407e0c24428f0","observation_id":"936f24ff-bbee-4b68-afa7-b98308ff62ee","resolution":{"observed_at":"2026-05-16T14:22:01.635191Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:50.139345Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2501.14249"},"observation_digest":"sha256:593a9c8e04be8cc47fbcfa3d7cbf3643ec1f06c17494e6497488b09148b077e1","observation_id":"be75ed09-53c6-4815-a5d7-86f23bc03ac8","resolution":{"observed_at":"2026-05-10T18:40:50.350304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-09T22:04:33.587373Z","title":"K., Perry, N., Dulepet, R., Ji, J., Lin, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00072","last_updated":"2025-01-31T05:33:48Z","snapshot_observed_at":"2026-08-09T21:59:08.230829Z","submitted_at":"2025-01-31T05:33:48Z","title":"LLM Cyber Evaluations Don't Capture Real-World Risk","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T22:04:33.587373Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2502.00072"},"observation_digest":"sha256:2c0a7eb87748d913033416ee44f8b641b50a0fc270338db0c1bf884beb4b1695","observation_id":"405ac15e-b490-4ee3-996c-fbf0126befe2","resolution":{"observed_at":"2026-08-09T22:04:33.587373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-08T23:10:11.149366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04227","last_updated":"2025-09-11T12:26:33Z","snapshot_observed_at":"2026-08-11T08:33:19.132706Z","submitted_at":"2025-02-06T17:12:43Z","title":"Can LLMs Hack Enterprise Networks? Autonomous Assumed Breach Penetration-Testing Active Directory Networks","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T23:10:11.149366Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2502.04227"},"observation_digest":"sha256:065a988b844d41049a6925f86fea2bad74811b548c937b95491ffe7f5e1851bd","observation_id":"fcd94e89-ae74-4576-a430-c68e8cb1942c","resolution":{"observed_at":"2026-08-08T23:10:11.149366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-08T14:48:44.828234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06656","last_updated":"2025-02-19T16:05:47Z","snapshot_observed_at":"2026-08-11T06:19:41.884756Z","submitted_at":"2025-02-10T16:47:00Z","title":"A Frontier AI Risk Management Framework: Bridging the Gap Between Current AI Practices and Established Risk Management","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T14:48:44.828234Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2502.06656"},"observation_digest":"sha256:4437262d46f313d810252851ef003c90e997700eb1754c168c07ac8610f2582f","observation_id":"4dd76008-2c7c-4b8e-a7d3-32227712fbce","resolution":{"observed_at":"2026-08-08T14:48:44.828234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-07T15:23:52.914666Z","title":"Zhang, Neil Perry, Riya Dulepet, Eliot Jones, Justin W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17107","last_updated":"2025-05-21T11:01:11Z","snapshot_observed_at":"2026-08-07T15:16:49.090252Z","submitted_at":"2025-05-21T11:01:11Z","title":"CRAKEN: Cybersecurity LLM Agent with Knowledge-Based Execution","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:52.914666Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2505.17107"},"observation_digest":"sha256:9c257f0f230ee21afc7bd3f795aabdb7253f2877c71b504beebdd58fe6448d2b","observation_id":"9c21991c-eadb-487d-9a76-7927a1c1cf7b","resolution":{"observed_at":"2026-08-07T15:23:52.914666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-07T12:02:35.406709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02048","last_updated":"2025-08-17T22:28:50Z","snapshot_observed_at":"2026-08-07T16:47:30.118976Z","submitted_at":"2025-06-01T01:59:52Z","title":"Improving LLM Agents with Reinforcement Learning on Cryptographic CTF Challenges","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:35.406709Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2506.02048"},"observation_digest":"sha256:12f4cbb6de2f238df4fe681895618e8679fdfc2aad8212e13163e9306e7fedcf","observation_id":"bc7718ec-e1a9-48e5-92f1-5b9dca55f357","resolution":{"observed_at":"2026-08-07T12:02:35.406709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-07T05:10:20.166338Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08693","last_updated":"2026-07-29T07:05:45Z","snapshot_observed_at":"2026-08-08T13:37:42.152205Z","submitted_at":"2025-06-10T11:11:55Z","title":"Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:20.166338Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2506.08693"},"observation_digest":"sha256:722160170684c30d69890073bcb2fb713c781c1b6c09fd7ebdd479017493db49","observation_id":"7794c2eb-86ab-446d-9979-d9af2c171628","resolution":{"observed_at":"2026-08-07T05:10:20.166338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-07T00:35:03.624759Z","title":"arXiv preprint arXiv:2408.08926 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13434","last_updated":"2025-06-16T12:52:19Z","snapshot_observed_at":"2026-08-10T20:55:41.907974Z","submitted_at":"2025-06-16T12:52:19Z","title":"From Promise to Peril: Rethinking Cybersecurity Red and Blue Teaming in the Age of LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:35:03.624759Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2506.13434"},"observation_digest":"sha256:4f59bcaaaba674d6d3953faffd2d4331ba65cc0ba6f15b7fcfee714dd68d20d0","observation_id":"71a0b358-a58c-4eae-a135-ff47b069821d","resolution":{"observed_at":"2026-08-07T00:35:03.624759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T20:24:28.287235Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-09T13:14:30.968472Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:28.287235Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.02825"},"observation_digest":"sha256:b911e828d3e0a7ae6c370522142dff9e63ab3be36fd8cb3d29e517eb938e9e3c","observation_id":"cb576ed1-53fe-4da0-ab9c-9c13e0aa1f7e","resolution":{"observed_at":"2026-08-06T20:24:28.287235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T19:39:59.356503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06260","last_updated":"2025-07-07T13:33:35Z","snapshot_observed_at":"2026-08-11T16:26:50.275059Z","submitted_at":"2025-07-07T13:33:35Z","title":"Evaluating the Critical Risks of Amazon's Nova Premier under the Frontier Model Safety Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:59.356503Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.06260"},"observation_digest":"sha256:ec43d9ae5e0f3b548d9250e36b523df2539f510305d2b6e9c8ef2189b2bae4fa","observation_id":"290af98a-b2cf-432e-bfdb-cf3e875068bd","resolution":{"observed_at":"2026-08-06T19:39:59.356503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T18:55:34.325643Z","title":"K., Perry, N., Dulepet, R., Ji, J., Menders, C., Lin, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.325643Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:4c3a1b1d916ffc92267a504d5e0c1f7e332df1b05ec048cc03f34069f18d2837","observation_id":"fc9251f0-e653-4768-ba17-b7bf3c19b967","resolution":{"observed_at":"2026-08-06T18:55:34.325643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2507.14201","last_updated":"2026-05-01T04:31:46Z","snapshot_observed_at":"2026-08-11T04:21:18.267564Z","submitted_at":"2025-07-14T17:06:26Z","title":"ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:33.942379Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.14201"},"observation_digest":"sha256:84f465ec533e0916dab3d0f4cd3fc78f090ef0116f3c8a25c2218a89ec822c9e","observation_id":"00418eaf-ba6c-4c13-b005-b4182b51cdd1","resolution":{"observed_at":"2026-05-19T04:42:04.771929Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T15:14:23.006196Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models.arXiv preprint arXiv:2408.08926,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16534","last_updated":"2025-07-26T12:33:42Z","snapshot_observed_at":"2026-08-10T02:11:35.629269Z","submitted_at":"2025-07-22T12:44:38Z","title":"Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:23.006196Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.16534"},"observation_digest":"sha256:60826a401aae7b34d0ef2938a75348586b40a856dd44cae4e179ab69dd9e64a0","observation_id":"ca2ca46d-83e1-4bf8-b634-cbf1ce3a42f3","resolution":{"observed_at":"2026-08-06T15:14:23.006196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T14:57:06.491612Z","title":"Zhang, Neil Perry, Riya Dulepet, Eliot Jones, Justin W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17257","last_updated":"2025-07-23T06:56:15Z","snapshot_observed_at":"2026-08-06T18:04:24.113657Z","submitted_at":"2025-07-23T06:56:15Z","title":"Agent Identity Evals: Measuring Agentic Identity","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:57:06.491612Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.17257"},"observation_digest":"sha256:5cd3538a2fe1e79a3fffd251f516284c2097026a61c157c68954f3963c549589","observation_id":"a2e33d96-9c84-4793-a4d4-08cedb088a61","resolution":{"observed_at":"2026-08-06T14:57:06.491612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T12:44:21.858357Z","title":"Zhang, Neil Perry, and Riya Dulepet et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.858357Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:9fdb42194a83987dd316d3d2c2d7e5ae49dc355710d931395a044840282dbea4","observation_id":"5207f360-b370-4439-a14b-e9273761fc7f","resolution":{"observed_at":"2026-08-06T12:44:21.858357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T05:57:29.522003Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01059","last_updated":"2025-08-01T20:25:57Z","snapshot_observed_at":"2026-08-09T20:48:33.918675Z","submitted_at":"2025-08-01T20:25:57Z","title":"Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T05:57:29.522003Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2508.01059"},"observation_digest":"sha256:9a1a0e421364d1cbe3ef898d81cbeaa5f0c2848ea75cbcb0c2787112b45ab86c","observation_id":"063639a0-1e72-4497-a8a7-3174e901d29a","resolution":{"observed_at":"2026-08-06T05:57:29.522003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-04T00:09:36.085164Z","title":"Cybench: A framework for evaluating cybersecurity capa- bilities and risks of language models.arXiv preprint arXiv:2408.08926, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02780","last_updated":"2026-02-23T13:17:25Z","snapshot_observed_at":"2026-08-08T06:24:41.301734Z","submitted_at":"2025-11-04T18:03:12Z","title":"PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T00:09:36.085164Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2511.02780"},"observation_digest":"sha256:e3e0b740c1a25e91d603702649d754eeaf08449d80f21ff51d19f54b7517c6bf","observation_id":"99d6da7f-8a57-4eda-a3e2-58af7100db2c","resolution":{"observed_at":"2026-08-04T00:09:36.085164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-02T19:43:40.853518Z","title":"white-hat","venue":null,"work_id":null,"year":2049},"citing_paper":{"arxiv_id":"2603.02277","last_updated":"2026-08-01T15:05:15Z","snapshot_observed_at":"2026-08-09T20:48:19.642961Z","submitted_at":"2026-03-01T22:47:39Z","title":"Quantifying Frontier LLM Capabilities for Container Sandbox Escape","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T19:43:40.853518Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2603.02277"},"observation_digest":"sha256:2cc31b4434afa2da3e01889efd621bc63ec6f5e9d076353330390e7b4df73a17","observation_id":"d5932e34-fc2d-4149-bfda-417ff6e36dd9","resolution":{"observed_at":"2026-08-02T19:43:40.853518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-04T06:01:01.313606Z","title":"white-hat","venue":null,"work_id":null,"year":2049},"citing_paper":{"arxiv_id":"2603.02277","last_updated":"2026-08-01T15:05:15Z","snapshot_observed_at":"2026-08-09T20:48:19.642961Z","submitted_at":"2026-03-01T22:47:39Z","title":"Quantifying Frontier LLM Capabilities for Container Sandbox Escape","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T06:01:01.313606Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2603.02277"},"observation_digest":"sha256:9503f2742c1c24d89314eb834e6e0304b65bda67fcb1a1225d8ec1f5df7399e8","observation_id":"8ffd15fe-f1cb-47df-870a-e1f7d5365307","resolution":{"observed_at":"2026-08-04T06:01:01.313606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.05719","last_updated":"2026-04-07T11:19:16Z","snapshot_observed_at":"2026-08-11T18:11:23.119647Z","submitted_at":"2026-04-07T11:19:16Z","title":"Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:57.225878Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.05719"},"observation_digest":"sha256:e57822de324fd9adcebee53af50b4bb09ef540adc1da9754e96b9e4f658840d0","observation_id":"d0189277-b3d4-40eb-b3dc-9def2a74622a","resolution":{"observed_at":"2026-05-10T23:45:52.939979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-02T16:40:51.515451Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models.arXiv:2408.08926, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.06550","last_updated":"2026-07-27T11:35:54Z","snapshot_observed_at":"2026-08-02T16:40:49.970902Z","submitted_at":"2026-04-08T00:58:48Z","title":"SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:51.515451Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.06550"},"observation_digest":"sha256:9807027089c121570920c53ac9bf5795fea2c72f989c5e32be4c79e571d17e74","observation_id":"3c7fb686-9676-4ddb-b92a-76b5e3a3191a","resolution":{"observed_at":"2026-08-02T16:40:51.515451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.12162","last_updated":"2026-04-14T00:43:20Z","snapshot_observed_at":"2026-08-10T13:12:32.844088Z","submitted_at":"2026-04-14T00:43:20Z","title":"AlphaEval: Evaluating Agents in Production","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:51.886471Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.12162"},"observation_digest":"sha256:4189ce01f0b61ab0e3e145b8f797b9d43fbd391806e34ec3dbb65d1ae60ea24b","observation_id":"58f31584-7ea9-41de-ab10-7890120d3c43","resolution":{"observed_at":"2026-05-11T08:45:58.817569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.17159","last_updated":"2026-04-18T22:13:23Z","snapshot_observed_at":"2026-08-11T04:29:00.962518Z","submitted_at":"2026-04-18T22:13:23Z","title":"Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T06:02:32.399075Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.17159"},"observation_digest":"sha256:9c599f7eee8a2dd8884eebb3d771eb77050765f45e2e36f12c359705d7c6a064","observation_id":"670e3a77-f49b-4e6a-b904-6acda6aaf242","resolution":{"observed_at":"2026-05-10T06:06:19.087529Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.23340","last_updated":"2026-04-25T15:00:14Z","snapshot_observed_at":"2026-08-11T14:02:21.327756Z","submitted_at":"2026-04-25T15:00:14Z","title":"Can LLMs be Effective Code Contributors? A Study on Open-source Projects","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T08:09:33.211692Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.23340"},"observation_digest":"sha256:5f78fa778f01f6e00103fdc0bb1bb641fb770c4915133e090c5fc35649aaf8d5","observation_id":"98a4d09b-b3c1-483c-8fd2-b68f5d949d6f","resolution":{"observed_at":"2026-05-11T20:46:10.852344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.24184","last_updated":"2026-04-27T08:44:30Z","snapshot_observed_at":"2026-08-05T23:07:15.910495Z","submitted_at":"2026-04-27T08:44:30Z","title":"Dynamic Cyber Ranges","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:03.611481Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.24184"},"observation_digest":"sha256:6ab21020d60bcb1e938fc11bdbc6dd6b2b05b11e7ff4b0adcc1257b0365ce9aa","observation_id":"af10d1ef-b6f1-4213-8cdb-52e0b21494d8","resolution":{"observed_at":"2026-05-11T22:16:53.348658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:b359fca6118ea4b1d7f4724a88db622ab506a4f402ef615e4cc957da1419b2fc","observation_id":"901fe0bd-f957-4028-ad60-c19de5e945c4","resolution":{"observed_at":"2026-05-11T23:16:16.399595Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.00072","last_updated":"2026-04-30T11:50:32Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T11:50:32Z","title":"XekRung Technical Report","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T20:55:10.400291Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.00072"},"observation_digest":"sha256:aee668465899ca0d7db6165ff360c79fa1d785bd43d8b5e3d4753ea885886e49","observation_id":"f3479441-714c-411a-b0ed-5fb2f8e5e57e","resolution":{"observed_at":"2026-05-11T14:51:14.588143Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.01186","last_updated":"2026-05-02T01:27:20Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T01:27:20Z","title":"Trace: Unmasking AI Attack Agents Through Terminal Behavior Fingerprinting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T15:18:43.426681Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.01186"},"observation_digest":"sha256:e1c1bef813972858904d24224adff6fd9c8ccb405ab7c6bc65b2d9bcc9ea7b98","observation_id":"6f2e4b70-ed75-4997-8ad4-4ded7d60ee4d","resolution":{"observed_at":"2026-05-11T16:41:18.994757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.06486","last_updated":"2026-05-07T16:07:41Z","snapshot_observed_at":"2026-08-02T21:44:55.115745Z","submitted_at":"2026-05-07T16:07:41Z","title":"Autonomous Adversary: Red-Teaming in the age of LLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T09:09:58.566171Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.06486"},"observation_digest":"sha256:331bf148c32eeb0de63babfcf9470acd217cd7bedcdb9612673a9cec1d13eae3","observation_id":"8c487224-e811-4da9-89bd-d92904e4ba7f","resolution":{"observed_at":"2026-05-11T20:26:10.508553Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.06601","last_updated":"2026-05-07T17:22:22Z","snapshot_observed_at":"2026-08-11T10:25:07.438500Z","submitted_at":"2026-05-07T17:22:22Z","title":"Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T08:51:33.112454Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.06601"},"observation_digest":"sha256:6afebe323c5ea685b73806f4f3f0d9d184f477c550ed66e80d0adce8d92d36ec","observation_id":"fb629ce5-673b-4c01-a4d6-b413708b2c71","resolution":{"observed_at":"2026-05-11T20:31:11.685007Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.07830","last_updated":"2026-05-08T14:57:53Z","snapshot_observed_at":"2026-08-11T02:37:55.149921Z","submitted_at":"2026-05-08T14:57:53Z","title":"CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:54:46.391345Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.07830"},"observation_digest":"sha256:9b332044059445ee38a482932c6d16106d573380519cb5acbe0045da9ee4ddef","observation_id":"056324e2-fb99-4104-b553-afcf4b86cac3","resolution":{"observed_at":"2026-05-11T04:10:57.348437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.10834","last_updated":"2026-07-28T07:30:21Z","snapshot_observed_at":"2026-08-02T14:32:21.223586Z","submitted_at":"2026-05-11T16:50:00Z","title":"From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T03:34:55.538935Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.10834"},"observation_digest":"sha256:57f15e22bf5d14866fa2fa3cea340a74e51f7b1cd285faae7f696c8b1e53d837","observation_id":"f204818c-98b3-493f-ab84-07171811d024","resolution":{"observed_at":"2026-05-12T07:16:27.972213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-02T14:22:27.655588Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.10834","last_updated":"2026-07-28T07:30:21Z","snapshot_observed_at":"2026-08-02T14:32:21.223586Z","submitted_at":"2026-05-11T16:50:00Z","title":"From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T14:22:27.655588Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.10834"},"observation_digest":"sha256:51b222ca0eec6222c274acc758321b5d329d0c0bd516c93cbab59bfa134c4e35","observation_id":"24ac8b9d-0e14-4b24-9694-01757c5bc2be","resolution":{"observed_at":"2026-08-02T14:22:27.655588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:504eefa1a879f90bc9458f717df480694c7a37e30552b96b7330051cbb7766ea","observation_id":"83f64bae-f5e2-4773-88c2-c67e3df1b3d2","resolution":{"observed_at":"2026-05-19T23:32:52.563721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.17416","last_updated":"2026-05-17T12:24:11Z","snapshot_observed_at":"2026-08-05T17:00:32.094950Z","submitted_at":"2026-05-17T12:24:11Z","title":"Benchmarking Mythos-Linked Bug Rediscovery","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T23:14:34.164854Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.17416"},"observation_digest":"sha256:6764e4f28c82a62b86f8e6149cfaa190c3a2fb457c6c7495d4d702f5eee5f291","observation_id":"33d9d0cc-241a-4c13-8df6-342a25d52c98","resolution":{"observed_at":"2026-05-19T23:17:57.552731Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.19099","last_updated":"2026-05-18T20:37:14Z","snapshot_observed_at":"2026-07-31T05:54:44.970755Z","submitted_at":"2026-05-18T20:37:14Z","title":"DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T10:16:38.920528Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.19099"},"observation_digest":"sha256:a95e7e9651c54d35e00a18e3cea7c712c48b728a931e2013271d540e8607788a","observation_id":"8584ade9-95b6-446c-bf9e-18902bde487f","resolution":{"observed_at":"2026-05-20T10:18:11.749362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.21773","last_updated":"2026-05-20T22:07:12Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T22:07:12Z","title":"HIDBench: Benchmarking Large Language Models for Host-Based Intrusion Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T08:52:34.079804Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.21773"},"observation_digest":"sha256:0fae05da5fc72f0915f19a3d6d595e231fb1b3b84820a926541c992e320cc08a","observation_id":"305c9254-29ad-43f3-8569-8b25cfa8cddf","resolution":{"observed_at":"2026-05-22T08:54:45.823514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:a66dd6d311e3f6ba0b1adcff5abc5b45a002c42d3c09758558f905279d903340","observation_id":"7e042dcc-a9f5-4faf-8701-a82bb982bb3f","resolution":{"observed_at":"2026-05-22T05:51:07.929199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:a6dcd2c0a67b5cacdd7be7d13ef5705079080c15dbad3e9f85b99c90f2d23a43","observation_id":"001041d1-9921-45e9-9866-f3db5b16d6ed","resolution":{"observed_at":"2026-05-25T06:06:43.185520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.28146","last_updated":"2026-05-27T08:29:28Z","snapshot_observed_at":"2026-08-04T10:57:53.122170Z","submitted_at":"2026-05-27T08:29:28Z","title":"Cybersecurity AI (CAI) Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T12:07:49.656453Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.28146"},"observation_digest":"sha256:c195f6f112748a86c6f27b2a681345051b56c9938eeb40f6090b7697d38c5580","observation_id":"0e1e3c4c-a3a3-4fc0-85fc-a7b7e84f2e31","resolution":{"observed_at":"2026-06-29T12:13:26.856759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.31593","last_updated":"2026-05-29T17:57:00Z","snapshot_observed_at":"2026-08-06T14:55:00.141524Z","submitted_at":"2026-05-29T17:57:00Z","title":"Stateful Online Monitoring Catches Distributed Agent Attacks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T21:54:44.072929Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.31593"},"observation_digest":"sha256:6de282a031bacc3a15cbd4a069c5bc872516cd60781c5cd3423537768d3440ea","observation_id":"ab106e19-42cb-47ed-b501-4f3b97b30ebf","resolution":{"observed_at":"2026-07-01T19:56:11.064697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2606.17114","last_updated":"2026-06-15T09:16:38Z","snapshot_observed_at":"2026-08-02T23:25:19.283217Z","submitted_at":"2026-06-15T09:16:38Z","title":"An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:39:36.657903Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2606.17114"},"observation_digest":"sha256:0be47a7171d37210a3cd888fc7e7c7963182429e85635c9bbd6f6209760126b6","observation_id":"d56a6cf9-90bf-410a-b13a-6f3bd59e972b","resolution":{"observed_at":"2026-07-03T17:48:46.344299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2606.24402","last_updated":"2026-06-23T10:37:34Z","snapshot_observed_at":"2026-08-03T12:40:07.880667Z","submitted_at":"2026-06-23T10:37:34Z","title":"Poisoned Playbooks: Demystifying Knowledge Poisoning Effects on AI Security Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-25T23:27:14.610097Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2606.24402"},"observation_digest":"sha256:df2d1f668556296de5e323de835bf0a9308afcb3c7785b98fda2564034a82080","observation_id":"99c16f9a-1b02-49bb-b4e3-14ce6bf99e4a","resolution":{"observed_at":"2026-07-04T17:40:01.102907Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2606.29175","last_updated":"2026-06-28T03:43:30Z","snapshot_observed_at":"2026-08-11T06:04:04.974629Z","submitted_at":"2026-06-28T03:43:30Z","title":"Direct Causation in International Humanitarian Law and the Challenge of AI-Mediated Civilian Cyber Operations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:49:28.819402Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2606.29175"},"observation_digest":"sha256:2b16431b614331d81b6989f72ef52e2caa4baf8a108e60d7fe9de9be462b0598","observation_id":"f1e2d4fa-4aef-4e74-9e82-9d19555f84d9","resolution":{"observed_at":"2026-06-30T07:54:22.125038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2607.01764","last_updated":"2026-07-02T06:27:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-07-02T06:27:27Z","title":"Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T14:02:06.173081Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.01764"},"observation_digest":"sha256:2ed475c034a0941108eaf0c51e287da28ba3790453ccc35404e4906cdf600756","observation_id":"b35eadfd-1caa-44b8-a2e7-2eb5d55a9303","resolution":{"observed_at":"2026-07-03T14:08:21.502047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T18:29:50.731038Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:9fe883060e359c48ee23c2dc65aa61046c24e38842fe2de26cde6802b07d3c3d","observation_id":"ef5f186d-bd5e-4b54-b7d1-5f3115183312","resolution":{"observed_at":"2026-07-10T18:37:31.169937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-03T00:49:47.662275Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T00:49:47.662275Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:3d6caa63a4680e8a707bb7f63ad36bf3fac7492e61edc89339c748889bc9f40a","observation_id":"65c92e11-d7bc-443a-8ac8-4bfc8b6376c6","resolution":{"observed_at":"2026-08-03T00:49:47.662275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T23:44:37.323064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.323064Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:0d47d3ad9c1c90d97701e770f959e554b70f95223e8da4d9b99f8db6a8127205","observation_id":"e5ec7e9b-7c8e-48ae-9d35-a983f0fcfb48","resolution":{"observed_at":"2026-08-01T23:44:37.323064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T21:24:15.880141Z","title":"and others , title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16112","last_updated":"2026-07-17T16:45:30Z","snapshot_observed_at":"2026-08-06T08:05:31.294310Z","submitted_at":"2026-07-17T16:45:30Z","title":"Harmonizing AI Safety Thresholds","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T21:24:15.880141Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.16112"},"observation_digest":"sha256:6d40c0ee5ae7bd727125d8059783050c524a7b89745f0c77ffcca63f5216dbe0","observation_id":"ceff4a75-aac0-40df-b438-27b6d540f7d0","resolution":{"observed_at":"2026-08-01T21:24:15.880141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T15:04:09.259606Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18575","last_updated":"2026-07-20T23:16:16Z","snapshot_observed_at":"2026-08-11T15:27:23.060543Z","submitted_at":"2026-07-20T23:16:16Z","title":"RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T15:04:09.259606Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.18575"},"observation_digest":"sha256:0b73ea125e97f6d45d896200349b4baf3c6011d5e093e17de85128ccb5e0e201","observation_id":"23646153-646d-483d-acfc-45130e22460a","resolution":{"observed_at":"2026-08-01T15:04:09.259606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T06:49:26.953693Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21763","last_updated":"2026-07-23T19:26:25Z","snapshot_observed_at":"2026-08-05T14:31:18.535114Z","submitted_at":"2026-07-23T19:26:25Z","title":"Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T06:49:26.953693Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.21763"},"observation_digest":"sha256:a55783e7b61428c18a20c72faaf1088a5e729752cb98f54a481812a2b85ed880","observation_id":"911f64eb-a401-452b-86ca-d0fc8217fff4","resolution":{"observed_at":"2026-08-01T06:49:26.953693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T02:31:26.073853Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25425","last_updated":"2026-07-28T08:21:41Z","snapshot_observed_at":"2026-08-09T20:48:15.985434Z","submitted_at":"2026-07-28T08:21:41Z","title":"The Disruptive Impact of Large Language Models on Capture the Flag Competitions and the Path Toward Fair Play","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:31:26.073853Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.25425"},"observation_digest":"sha256:202887337f73fde34d5de9435e8ebedd8d27ee513d7fbfe615eae851a1e1403a","observation_id":"579da816-ab2d-4ffb-98f7-0939b6df73a4","resolution":{"observed_at":"2026-08-01T02:31:26.073853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T00:13:37.291705Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-09T23:14:14.859316Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.291705Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:bb2b5f3583eb634821362374c1278b50f43c40f6109b3a8d546d259a9d46c758","observation_id":"8c75942d-277b-4329-a925-2a8d7343f2de","resolution":{"observed_at":"2026-08-01T00:13:37.291705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-08T04:19:18.902915Z","title":"arXiv preprint arXiv:2408.08926 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03009","last_updated":"2026-08-04T01:42:43Z","snapshot_observed_at":"2026-08-09T09:33:23.692118Z","submitted_at":"2026-08-04T01:42:43Z","title":"Tiny Enough to Break In: Agentic Remote Access Trojans Powered by Small Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T04:19:18.902915Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2608.03009"},"observation_digest":"sha256:1873ff63e74ecade72810c226d63b95e0181f48a54de8c53806ddeade5f4a8bf","observation_id":"ccc8c6be-b185-4ddf-95ee-b317d5299044","resolution":{"observed_at":"2026-08-08T04:19:18.902915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.08926/citation-record","integrity":"/paper/2408.08926/integrity","json":"/paper/2408.08926/citation-record.json","paper":"/paper/2408.08926"},"outbound":[],"paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","latest_version":4,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 56 inbound Pith citation observations for arXiv:2408.08926."}