{"as_of":"2026-08-18T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4137004d5af9bd76460265f3f6482c135de8dcacb0e61e11a6baa9ba4854e02f","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:53:33.486755Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:25:15.771731Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T23:51:45.015967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14682","snapshot_observed_at":"2026-08-06T14:25:15.771731Z","title":"Airtbench: Measuring autonomous ai red teaming capabilities in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19399","last_updated":"2025-07-25T16:06:16Z","snapshot_observed_at":"2026-08-16T16:08:33.634938Z","submitted_at":"2025-07-25T16:06:16Z","title":"Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T14:25:15.771731Z"},"links":{"cited_paper":"/paper/2506.14682","citing_paper":"/paper/2507.19399"},"observation_digest":"sha256:91c328788ab4796a55f83ba48e0cc1f9461429345bbff864a9015a41f9977e15","observation_id":"d2a4ce5b-b37f-44f8-b429-c30af3ddcabc","resolution":{"observed_at":"2026-08-06T14:25:15.771731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14682","snapshot_observed_at":"2026-08-04T00:09:33.025834Z","title":"Airtbench: Measuring autonomous ai red teaming capabilities in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02780","last_updated":"2026-02-23T13:17:25Z","snapshot_observed_at":"2026-08-15T00:24:37.042566Z","submitted_at":"2025-11-04T18:03:12Z","title":"PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:09:33.025834Z"},"links":{"cited_paper":"/paper/2506.14682","citing_paper":"/paper/2511.02780"},"observation_digest":"sha256:8cbdbe5a8106ffa8ea2075656fe8c2ad7f1e6df906a1d31a37fbeb915ed68df5","observation_id":"3dff4f9f-4458-46a4-955f-7c6083e29f80","resolution":{"observed_at":"2026-08-04T00:09:33.025834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"cited_work":{"arxiv_id":"2506.14682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14682","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models.arXiv preprint arXiv:2506.14682","venue":null,"work_id":"d0eb801c-02e0-4911-a89d-2a84867e01f4","year":null},"citing_paper":{"arxiv_id":"2605.04019","last_updated":"2026-05-05T17:43:52Z","snapshot_observed_at":"2026-08-14T01:28:50.207494Z","submitted_at":"2026-05-05T17:43:52Z","title":"Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:06:18.057868Z"},"links":{"cited_paper":"/paper/2506.14682","citing_paper":"/paper/2605.04019"},"observation_digest":"sha256:e31946932676ac522a12e3a70ca2bf6ba97020fd79ed19e756508353e5a9152d","observation_id":"898cf871-8391-4070-931f-3fb691354ef7","resolution":{"observed_at":"2026-05-11T23:51:45.056581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14682/citation-record","integrity":"/paper/2506.14682/integrity","json":"/paper/2506.14682/citation-record.json","paper":"/paper/2506.14682"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.17238","last_updated":"2025-04-06T23:46:59Z","snapshot_observed_at":"2026-08-16T13:49:00.723459Z","submitted_at":"2024-05-27T14:53:35Z","title":"IRIS: LLM-Assisted Static Analysis for Detecting Security Vulnerabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17238","snapshot_observed_at":"2026-08-15T19:53:32.591918Z","title":"Llm-assisted static analysis for detecting security vulnerabilities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.591918Z"},"links":{"cited_paper":"/paper/2405.17238","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f83da92942cbf92cd582d276435964c6759b227b8bee8f0c940da210d68dc5da","observation_id":"5786a459-44e7-455b-ae16-95ad0238f8f1","resolution":{"observed_at":"2026-08-15T19:53:32.591918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07049","last_updated":"2025-02-12T23:19:23Z","snapshot_observed_at":"2026-08-16T07:59:02.968423Z","submitted_at":"2025-02-10T21:33:38Z","title":"LLMs in Software Security: A Survey of Vulnerability Detection Techniques and Insights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07049","snapshot_observed_at":"2026-08-15T19:53:32.622526Z","title":"Llms in software security: A survey of vulnerability detection techniques and insights, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.622526Z"},"links":{"cited_paper":"/paper/2502.07049","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:6bdc753c055b2330592ec00f49eab68dcb6d5fadf9200cf29fdbbd3018d8ed89","observation_id":"d6d8958e-1ec8-4462-9ae4-d15fa45b3c4b","resolution":{"observed_at":"2026-08-15T19:53:32.622526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11814","last_updated":"2024-02-19T04:08:44Z","snapshot_observed_at":"2026-08-16T14:17:30.139500Z","submitted_at":"2024-02-19T04:08:44Z","title":"An Empirical Evaluation of LLMs for Solving Offensive Security Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11814","snapshot_observed_at":"2026-08-15T19:53:32.627164Z","title":"An empirical evaluation of llms for solving offensive security chal- lenges, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.627164Z"},"links":{"cited_paper":"/paper/2402.11814","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:c3dc3ec9099799962b4c8a5befd0a02629e8c287df61e9cefd5108384178f023","observation_id":"a2bdf34d-1c59-44e8-ba29-1d6dd7929034","resolution":{"observed_at":"2026-08-15T19:53:32.627164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06664","last_updated":"2024-02-16T04:02:51Z","snapshot_observed_at":"2026-08-16T14:20:59.361566Z","submitted_at":"2024-02-06T14:46:08Z","title":"LLM Agents can Autonomously Hack Websites","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06664","snapshot_observed_at":"2026-08-15T19:53:32.631740Z","title":"Llm agents can autonomously hack websites, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.631740Z"},"links":{"cited_paper":"/paper/2402.06664","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:b7adc7253f706309b09f123d93dcf627bcd5c021a1ac14e902390e25d0d8375a","observation_id":"8cdf4899-13d1-4341-9b92-d3897291a8c3","resolution":{"observed_at":"2026-08-15T19:53:32.631740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.294456Z","title":"Llm4decompile: Decompilingbinarycodewithlargelanguagemodels,","venue":null,"work_id":"9c19f258-a6b9-4965-bc5a-ff47ba6b2ccd","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.637031Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:d64fbce00b24a6cf278942fc1855ae43405d3cd9780e424685a4087f85eca351","observation_id":"b8956961-49fd-4354-b263-91394b2e0055","resolution":{"observed_at":"2026-08-15T19:53:34.298021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T19:53:32.644504Z","title":"Evaluating large language models trained on code, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.644504Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:09eeeda714e06307640376bac6e2d080c58116df84b91b72df9b3f7c44231e64","observation_id":"f6cc0e37-7723-497a-a17c-3d861bd3a300","resolution":{"observed_at":"2026-08-15T19:53:32.644504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.284290Z","title":"ATLAS - Adversarial Threat Landscape for Artificial-Intelligence Systems","venue":null,"work_id":"f56a9084-3028-4d19-a484-555c5237e2d8","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.674375Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:3c8e845f82018c601a00bf924e0f80010580944762b61e9347ed7ccd2fdbd4cc","observation_id":"b17f629e-780e-4ca8-b4e4-0430f937be60","resolution":{"observed_at":"2026-08-15T19:53:34.287871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.269183Z","title":"OWASP Top Ten for Large Language Model Applications","venue":null,"work_id":"bcf97634-7922-4b03-906a-116a08d1c9ca","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.679927Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:48262e53b9df80330dfd75867b0cc9e2a1a126f5f00f590fe1191d95f15ad741","observation_id":"a10781cf-654c-441a-ac0e-f37410e03917","resolution":{"observed_at":"2026-08-15T19:53:34.276513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T19:53:32.684251Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.684251Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:2cad08dd081ee1b07ffeff02cf7ff8b4ca34ab7d40c2fd191433b43f687a7e04","observation_id":"cd5fef5e-240c-472a-953b-0c62d239a656","resolution":{"observed_at":"2026-08-15T19:53:32.684251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T19:53:32.689085Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.689085Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:eee43d6e330db1e11912b209c02ce97b03297e386bd99fa41d17a978ebf308e2","observation_id":"ee12daaa-f90a-435c-a0a1-70b9f18a4511","resolution":{"observed_at":"2026-08-15T19:53:32.689085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:53:32.693437Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforce- ment learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.693437Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:b99e63899fc83b3fce49378e74d48ef2ce9d7ab0e1edb8bbcea629cc7817931e","observation_id":"786fffbf-ad22-4c29-9c6b-fc7f941845ed","resolution":{"observed_at":"2026-08-15T19:53:32.693437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.257233Z","title":"OpenAI o1 System Card","venue":null,"work_id":"c5989ed0-3e73-4381-a935-1e4730790d0f","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.697337Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:9064c748ca53061a4897a6bc920976c9e5c5cfdcfea6cb35959fee4bf8873f03","observation_id":"1aec31e9-929e-4d0b-91d4-37a68ad00980","resolution":{"observed_at":"2026-08-15T19:53:34.262382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14963","last_updated":"2025-03-27T07:08:33Z","snapshot_observed_at":"2026-08-16T13:58:33.568799Z","submitted_at":"2024-04-23T12:16:05Z","title":"Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14963","snapshot_observed_at":"2026-08-15T19:53:32.701223Z","title":"Achieving >97better solvers for math word problems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.701223Z"},"links":{"cited_paper":"/paper/2404.14963","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:1038339ec596c65788eb0dd501cbd35ef37c939420ba8a6af117e58df2984ad6","observation_id":"648e0d2c-4834-4711-b100-5d48e8b50c1e","resolution":{"observed_at":"2026-08-15T19:53:32.701223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12644","last_updated":"2025-07-21T01:47:18Z","snapshot_observed_at":"2026-08-16T13:41:48.765760Z","submitted_at":"2024-06-18T14:12:27Z","title":"Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12644","snapshot_observed_at":"2026-08-15T19:53:32.705945Z","title":"Hierarchical prompting taxonomy: A universal evaluation framework for large language models aligned with human cognitive principles, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.705945Z"},"links":{"cited_paper":"/paper/2406.12644","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:0091fbf6523cb039bc8497973cc2fa17eb0df7ee6c132e4689313c57c8aba31b","observation_id":"37b18dbc-7422-4518-9dc3-0f954283512b","resolution":{"observed_at":"2026-08-15T19:53:32.705945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-18T08:11:45.716032Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-15T19:53:32.725506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.725506Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f035ef7489f27aa1192b3c8462fa72ed16b5ea1e7806c28351ae71935a22da9a","observation_id":"415e0e21-ec74-46e4-b7a1-af7ae258fcce","resolution":{"observed_at":"2026-08-15T19:53:32.725506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.209420Z","title":"Jimenez, John Yang, Kai Liu, and Aleksander Madry","venue":null,"work_id":"03b59187-5d4c-4b7d-9a45-962033314789","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.756599Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:95407c04040553f19063e38a74d5ed0b2460f0ebbcc0813fdb0a8e10e97db62f","observation_id":"08056cae-2d1e-4ed9-962f-f7d42c40eb71","resolution":{"observed_at":"2026-08-15T19:53:34.249705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-14T22:26:00.902198Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-15T19:53:32.783357Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.783357Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:15521d89e519388148b3397a07922a3c149b984cade5b0733fefeb9ed0e1ad01","observation_id":"113acd9c-9a00-4443-9b82-41d4088c02d2","resolution":{"observed_at":"2026-08-15T19:53:32.783357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-15T19:53:32.791730Z","title":"Agentbench: Evaluating llms as agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.791730Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:c300517caa79f0b6c4fccf05fd4f0232629ce75f2720534e2fd23e49841b8cf3","observation_id":"a39166fe-2e49-45b5-96c4-593488160ad8","resolution":{"observed_at":"2026-08-15T19:53:32.791730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-15T19:53:32.795634Z","title":"Webarena: A realistic web environment for building autonomous agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.795634Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:5fc2933ed066ad89984440e09c044e12801f3dcf3368f565f98283080476572f","observation_id":"1ac4ff36-5be3-4839-8875-091815b144b3","resolution":{"observed_at":"2026-08-15T19:53:32.795634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-08-14T08:19:18.935225Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-15T19:53:32.803200Z","title":"Mind2web: Towards a generalist agent for the web, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.803200Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:99e9cd8ba7d5ebab196e6ef614e62ca37bbc048b281e477c80d44d68749f2ab5","observation_id":"b8383111-e426-45e0-b10a-14028c21132d","resolution":{"observed_at":"2026-08-15T19:53:32.803200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-15T19:53:32.807624Z","title":"Swe-agent: Agent-computer interfaces enable automated software en- gineering, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.807624Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:076482a9360c550174b5f12b6aa2f7e41911f2ef3c8853af57bd8a5e8bb127b5","observation_id":"1608e2a3-8a37-42b2-9663-684db5f7e669","resolution":{"observed_at":"2026-08-15T19:53:32.807624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.107486Z","title":null,"venue":null,"work_id":"1197e51d-89e8-4c26-9395-42328557a4d8","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.814010Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:b860e133db2a64561aa1a2f7c5a522bb8978797e2286a0c50eed5f8e52eae31b","observation_id":"dd6e4679-7a17-4487-8954-34b71f13326a","resolution":{"observed_at":"2026-08-15T19:53:34.149152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14898","last_updated":"2023-10-30T17:52:18Z","snapshot_observed_at":"2026-08-16T15:20:59.876100Z","submitted_at":"2023-06-26T17:59:50Z","title":"InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14898","snapshot_observed_at":"2026-08-15T19:53:32.840618Z","title":"Intercode: Standardizing and benchmarking interactive coding with execution feedback, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.840618Z"},"links":{"cited_paper":"/paper/2306.14898","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:a2cafead977f4966ea49535bd37b1bd7a915b7a08e0878749968b0e1e4ae8e29","observation_id":"0a2b9505-3ecd-448a-985a-de94353d94c7","resolution":{"observed_at":"2026-08-15T19:53:32.840618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-08-16T20:14:18.570887Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-15T19:53:32.863240Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.863240Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:01b772f55e9205e871ddb42b52cb7dbf21e696f5c37d2ec4502fda57dfe428a8","observation_id":"ef0eb5b6-ae4b-416e-a836-0b3f445ab6ca","resolution":{"observed_at":"2026-08-15T19:53:32.863240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16165","last_updated":"2025-06-05T10:58:02Z","snapshot_observed_at":"2026-08-17T15:33:11.238356Z","submitted_at":"2024-09-24T15:06:01Z","title":"EnIGMA: Interactive Tools Substantially Assist LM Agents in Finding Security Vulnerabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16165","snapshot_observed_at":"2026-08-15T19:53:32.885270Z","title":"Interactive tools substantially assist lm agents in finding security vulnerabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.885270Z"},"links":{"cited_paper":"/paper/2409.16165","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f0b1ca7405af8c7f9fd32190aee636eac49f4aeb8bee39b6e1eb3c1ac5d81329","observation_id":"8cbe8746-024a-480d-8048-9548adcda81f","resolution":{"observed_at":"2026-08-15T19:53:32.885270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01811","last_updated":"2025-03-03T18:39:48Z","snapshot_observed_at":"2026-08-16T12:53:29.210088Z","submitted_at":"2025-03-03T18:39:48Z","title":"AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01811","snapshot_observed_at":"2026-08-15T19:53:32.995201Z","title":"Autoadvexbench: Benchmarking autonomous exploitation of ad- versarial example defenses, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.995201Z"},"links":{"cited_paper":"/paper/2503.01811","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:e63853c8b6efcd13272738c794080f27b23bcafee6da50435f6b10c4727a2567","observation_id":"24625837-5955-4a37-a26f-c90c28372f39","resolution":{"observed_at":"2026-08-15T19:53:32.995201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.052921Z","title":"Picoctf learning.https://www.picoctf.org/, 2024","venue":null,"work_id":"d28a705d-d190-4ed6-8471-e6b8a4c113de","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.103438Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:8c689afd8cc2cecdba28183b92d0ee236f0dd74ac274d7dcac1ab5877444cd15","observation_id":"38c7678a-0a84-41de-9196-0ece445f7681","resolution":{"observed_at":"2026-08-15T19:53:34.077377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.022961Z","title":"Ai village capture the flag @ defcon31.https://kaggle.com/ competitions/ai-village-capture-the-flag-defcon31, 2023","venue":null,"work_id":"2b2cbb29-3d06-42f0-b042-7f9b22a4c974","year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.122420Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:273095f09faa0e26a995e3387af722d77e2723a1ed59f760355949116e5c2078","observation_id":"54ec6960-1b49-4018-b144-1c0b1af26992","resolution":{"observed_at":"2026-08-15T19:53:34.026552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.011696Z","title":"Jupyter datascience notebook docker image, 2025","venue":null,"work_id":"d63488c5-f111-4883-a6c0-b060a9864bfb","year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.131197Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:a8aaceedcd0ccc708bbee00be9d4a4fa4920743844d3edc53ffa42735b5e388f","observation_id":"d877e2e1-e64c-4c89-8521-0132a06329a0","resolution":{"observed_at":"2026-08-15T19:53:34.016063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10577","last_updated":"2024-08-20T06:32:57Z","snapshot_observed_at":"2026-08-18T02:48:53.419690Z","submitted_at":"2024-08-20T06:32:57Z","title":"Optimizing Large Language Model Hyperparameters for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10577","snapshot_observed_at":"2026-08-15T19:53:33.154793Z","title":"Optimizing large language model hyperparameters for code genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.154793Z"},"links":{"cited_paper":"/paper/2408.10577","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:d4f0012fa04b66952879618ef5845549f9b25b0264c968fb987010f34cb2bef7","observation_id":"72825d09-5f60-42c1-8844-985a27434988","resolution":{"observed_at":"2026-08-15T19:53:33.154793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19855","last_updated":"2025-04-29T02:52:54Z","snapshot_observed_at":"2026-08-18T02:00:51.986997Z","submitted_at":"2025-04-28T14:48:00Z","title":"The Automation Advantage in AI Red Teaming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19855","snapshot_observed_at":"2026-08-15T19:53:33.168800Z","title":"< platform - api - key >","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.168800Z"},"links":{"cited_paper":"/paper/2504.19855","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:b36b65bfca81673a3b842fc707a10d5272fa043ecd8099681199d19dc962e717","observation_id":"dbdd6fc6-cfb3-4bf4-9e40-81635bd17218","resolution":{"observed_at":"2026-08-15T19:53:33.168800Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.978159Z","title":"For example : ‘t = turtle","venue":null,"work_id":"27df0b07-00ca-462c-995b-36e668be3651","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.281100Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:8feef4bfbc792c9a287eb9e86ef32722b39b0807f749b8052c5dd4859a8d8021","observation_id":"4d833146-c9cd-4247-aa55-ccfec3df252c","resolution":{"observed_at":"2026-08-15T19:53:33.981683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.967647Z","title":"S Y S T E M _ C O M M A N D _ E X E C U T E D _ V I A _ E X E C","venue":null,"work_id":"9f0da288-9d47-4ced-8abb-843aedd80a37","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.295834Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:4e0b263c1edd269d8f5cac2db09132bbf27556a230f77033cad72bbf259fa7a2","observation_id":"69d706f8-82b6-4039-bad0-b471a24bdfc3","resolution":{"observed_at":"2026-08-15T19:53:33.970997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.956831Z","title":null,"venue":null,"work_id":"b6219e2d-2a67-4b6b-a70c-80986b577fd6","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.306754Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f348b1975b25c5d27fcf05e36e4433adb3a5ea43c6dc158bc8adaca9c9490827","observation_id":"ec659ead-6b3c-40ff-8c8f-0b0fbabd57e1","resolution":{"observed_at":"2026-08-15T19:53:33.959915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.945054Z","title":"For example : ‘t","venue":null,"work_id":"7ccedfad-6885-4fc6-b4cd-76f5fe995918","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.310734Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:3dda5de80cb849f7edb5fe3b5e70a1a440597da143501e0a1d8c272b0e7b5806","observation_id":"d19cd96b-6aff-4075-9e4c-415cf88b77b7","resolution":{"observed_at":"2026-08-15T19:53:33.949128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.866461Z","title":"\" \" response = query ( prompt ) print ( response ) </ execute - code > <result idx=0 success=True> ’output’:","venue":null,"work_id":"e9643692-7cb7-4b03-b57b-693fe7d12f59","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.314088Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f1ec76f476bbb5eceda59afdf09f0a894efe4c4a279318f9e9b5a8d2332a200b","observation_id":"1953971f-4bdf-445d-a1dc-cdb47053335a","resolution":{"observed_at":"2026-08-15T19:53:33.911454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.000617Z","title":null,"venue":null,"work_id":"14b676a4-3a76-44a7-874f-90e2fcc0e7d4","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.325454Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f123807ec423b5a2a606456d8d094116a355eb7a6bbbb3022b26d1e468e4a102","observation_id":"54452e34-cca5-47bf-84db-6e10008c0787","resolution":{"observed_at":"2026-08-15T19:53:34.004403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.988570Z","title":null,"venue":null,"work_id":"14e6d801-db58-465e-b89a-9e0877ba2ae2","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.353697Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:1ca129e3dd9966d01fa19f5ed3c25dea43975c24f4fdd4450e6e9f0e353ab56f","observation_id":"26208294-c958-4518-9989-3308f74bc1ef","resolution":{"observed_at":"2026-08-15T19:53:33.992721Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.821202Z","title":"Example : ‘t = turtle","venue":null,"work_id":"be94e923-1d18-473c-af91-4d0cbeb027ce","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.388384Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:361da3bd8c65b1633e4f003a932a6b07fc3044c46cad016d00b309c66e55224c","observation_id":"a264a8e2-edc5-4510-bf98-42b4c350f91e","resolution":{"observed_at":"2026-08-15T19:53:33.840388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.790761Z","title":"echo J A G A _ L L M _ G E N E R A T E D _ O S _ C O M M A N D","venue":null,"work_id":"013957b2-ca06-40f7-8ed6-53bda7859f29","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.430804Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:9170ee9fa689669d7a9c2a6225db09322d50f977aee5d9db162e98726794c87f","observation_id":"f768c676-7a52-4781-8769-fc5bad636043","resolution":{"observed_at":"2026-08-15T19:53:33.794439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.778965Z","title":"system () ‘ call , make the turtle ‘t ‘ draw a square of side 10","venue":null,"work_id":"2d5bf9cb-68e0-4b5e-b746-4d612c46b454","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.465619Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f3f5a539261ea8a3544d4449a42cac0bf5a02d8152a549820a708a94699be603","observation_id":"46ed088a-d71e-42bc-a856-3b11fd256ca3","resolution":{"observed_at":"2026-08-15T19:53:33.783066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.765796Z","title":"\" \" response = requests . post ( f","venue":null,"work_id":"9a8dec62-22b1-49e8-b5f9-3d063bb154aa","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.486755Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:e4f0a31fb91f98f8da3b86d9c5d699f31f8cecf784878c867d00ce483ab06326","observation_id":"ef0f6acf-4d21-45a9-ba3c-2e6328803dec","resolution":{"observed_at":"2026-08-15T19:53:33.770156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05286","last_updated":"2024-10-22T03:58:20Z","snapshot_observed_at":"2026-08-16T14:11:37.942836Z","submitted_at":"2024-03-08T13:10:59Z","title":"LLM4Decompile: Decompiling Binary Code with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05286","snapshot_observed_at":"2026-08-15T19:53:32.640743Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.640743Z"},"links":{"cited_paper":"/paper/2403.05286","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:785f33b5de964efe749cd492f33fe5b8f9bda9ce46867c1abb50cef56a4250a0","observation_id":"c505c07d-fa71-48f9-a6f4-360ef26a4f7d","resolution":{"observed_at":"2026-08-15T19:53:32.640743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-18T02:31:10.327662Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":25,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2506.14682."}