{"as_of":"2026-08-21T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e41a66fc7167a068a576c702b53fe1a5bd588be93e0d52ae0ed67c96221d5b4","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:04:40.936182Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03070/citation-record","integrity":"/paper/2608.03070/integrity","json":"/paper/2608.03070/citation-record.json","paper":"/paper/2608.03070"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-08T01:04:40.800351Z","title":"gpt-oss-120b & gpt-oss-20b model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.800351Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:2ed650bf57641a7ab1aefa8b7a3f40361b9c2368635b8f0d76b95522d0dc1c4d","observation_id":"486f349b-b9d2-42d9-8d97-0c6bd8f05cbd","resolution":{"observed_at":"2026-08-08T01:04:40.800351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.714488Z","title":"Our evaluation of OpenAI’s GPT-5.5 cyber capabilities, 2026","venue":null,"work_id":"74949b73-69e9-444e-ba6e-f744957be97a","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.804895Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:0f9244b198cc2f090f328821a2a0199f1a44843dbc0b1059970c9e22bddea408","observation_id":"00822f6b-9cd3-486a-a667-1ad9952ecd6b","resolution":{"observed_at":"2026-08-08T01:04:41.717747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.704863Z","title":"Our evaluation of Claude Mythos Preview’s cyber capabilities, 2026","venue":null,"work_id":"cbab213d-f8f6-49e8-b32c-1d1e9b84fcca","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.808590Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:762d371204a11440472f32547a18576ac4b6679d44266b834e8fe58cbd60cb5a","observation_id":"921e6ce0-e3b2-4dbe-9683-f8857cdb3622","resolution":{"observed_at":"2026-08-08T01:04:41.708262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.695815Z","title":"Constitutional Classifiers: Defending against universal jailbreaks, February 2025","venue":null,"work_id":"927f740d-9370-4596-a362-a541fe03ed3d","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.812066Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:d471a97dbd760d19aae1ad7aa8621747f633e3722ebec3901dc957ff48ecaf78","observation_id":"68433ac3-357a-459b-b927-30ab800cbf9e","resolution":{"observed_at":"2026-08-08T01:04:41.699247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.686217Z","title":"Disrupting the first reported ai-orchestrated cyber espionage campaign, 2025","venue":null,"work_id":"fad77d1e-d43a-438f-8459-3bade0771867","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.815425Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:6a788130e0dc0a9f586031cc8e7d6f94addd58639f981dadd401d468e6d7b798","observation_id":"5e9af83b-b20c-4971-8b95-8ac4c98bfb4e","resolution":{"observed_at":"2026-08-08T01:04:41.689793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-08T01:04:40.818991Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.818991Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:aaaccd16c4cdc744c332e854ee654710fc150a37fbd0d002e2c89a090d8fa0a3","observation_id":"8ebe1614-0dac-47a8-b3d5-f23ef00d43fd","resolution":{"observed_at":"2026-08-08T01:04:40.818991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.822825Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.822825Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:170d6c9c5038df7f437d471f96fcecab2c53de4237a500eb71ed742afa5974c6","observation_id":"dbe28a52-b414-451e-999a-f397cc2723b0","resolution":{"observed_at":"2026-08-08T01:04:40.822825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.825990Z","title":"Constitutional classifiers++: Eﬀicient production-grade defenses against universal jailbreaks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.825990Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:0d0ed3cecda3286bd95b356cc5d2189ab8f97d7f540fbd9166efb294b4959d85","observation_id":"bd399f56-0609-4170-915b-3919fcb5cd6c","resolution":{"observed_at":"2026-08-08T01:04:40.825990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.829056Z","title":"Boundary point jailbreaking of black-box llms, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.829056Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:e2d00bf6c914ea6111a11d51bdcbd55827cb5bc58496e468c9cee2243e31b86f","observation_id":"d4c42b4f-2a40-4877-8248-ec8866a67713","resolution":{"observed_at":"2026-08-08T01:04:40.829056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.676038Z","title":"Deepseek-v4: Towards highly eﬀicient million-token context intelligence, 2026","venue":null,"work_id":"d18ca757-909a-49cf-a160-6d56b1c49936","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.832135Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:f723e4cfc820d2a159db2f044caaa347fad04db5d4a760bcfdf4da511cf838f1","observation_id":"8e302ba0-1a01-4499-8b35-d7db3113287f","resolution":{"observed_at":"2026-08-08T01:04:41.679664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.666407Z","title":"The safety gap toolkit: Evaluating hidden dangers of open-source models","venue":null,"work_id":"e605ec40-c306-4d3f-9988-c5a1a8b84b57","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.835276Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:3fd7317b0f3a78f718bd4004baa0ae590d510940269baf83c44761eded69a54b","observation_id":"974e515b-6c36-4a76-b531-59b2b6b748e1","resolution":{"observed_at":"2026-08-08T01:04:41.669906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.656757Z","title":null,"venue":null,"work_id":"9094ca99-bedf-4f6a-acac-d69be9a8519f","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.838399Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:541475d6a66df2a7bced6c58cd793f50cacb7f8ba47d715442c75f84e1cbe222","observation_id":"c2cc9033-fcb5-404e-b5bc-6a51103e706d","resolution":{"observed_at":"2026-08-08T01:04:41.660329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-17T07:21:20.458339Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T01:04:40.841373Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.841373Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:d088aff1f5d1da4150dfd1dafccf476e84da5df479b7176849d3f2390f60726b","observation_id":"50f5ab3b-2cb7-4d9f-b6dd-cb0e3db16493","resolution":{"observed_at":"2026-08-08T01:04:40.841373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16137","last_updated":"2025-04-29T15:14:35Z","snapshot_observed_at":"2026-08-16T11:24:31.452137Z","submitted_at":"2025-04-21T21:04:01Z","title":"Virology Capabilities Test (VCT): A Multimodal Virology Q&A Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16137","snapshot_observed_at":"2026-08-08T01:04:40.844948Z","title":"Virology Capabilities Test (VCT): A multimodal virology q&a benchmark, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.844948Z"},"links":{"cited_paper":"/paper/2504.16137","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:0797b5f57f4377035d62e2ec0da2642ea0d88592de1f1f56d4e3e48a91b7c5f6","observation_id":"5dac27c1-ce00-407f-b11b-92a491cf6dca","resolution":{"observed_at":"2026-08-08T01:04:40.844948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.646954Z","title":"Openai let chatgpt aid and abet mass shooters, florida lawsuit claims, 2026","venue":null,"work_id":"c8719948-c454-4307-8916-a0790a51c57f","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.848365Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:245a87aa1245d7d77331d25f09f3896812c15a5b4029e7ae0f3ec033fb3050cf","observation_id":"774cb533-c83e-4232-9a8b-840c9f9bfdc6","resolution":{"observed_at":"2026-08-08T01:04:41.650799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.637504Z","title":"God Has Helped Us, and So Will AI","venue":null,"work_id":"162059ef-7817-41ea-a11b-5de7746ed5b1","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.851461Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:6c17b9df5ac1253f863d5e190db6423ed691a59e21a818558d190b5607c780ed","observation_id":"ac7b7765-dcc5-4c5c-a68d-0f42c6539bd1","resolution":{"observed_at":"2026-08-08T01:04:41.641029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.854468Z","title":"McKenzie, Oskar J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.854468Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:e06178ac3886578f8b0cf1e4f41d49442c4167d82915ddd452ef5b343915e121","observation_id":"5c60ab4c-7a46-4812-8b03-d95718c6c93e","resolution":{"observed_at":"2026-08-08T01:04:40.854468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.627535Z","title":"Common elements of frontier AI safety policies, 2025","venue":null,"work_id":"4c19ab01-ab0e-4601-b72a-c666e8280ae9","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.857439Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:35ddce1874cee0f7cc3d52fc9e1b5f1f53107469f053e5846ad999eabd3613cc","observation_id":"5352fe49-0ae7-4ba0-be5b-86492d0ddb08","resolution":{"observed_at":"2026-08-08T01:04:41.631341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10694","last_updated":"2025-04-14T20:30:41Z","snapshot_observed_at":"2026-08-16T12:41:09.495405Z","submitted_at":"2025-04-14T20:30:41Z","title":"The Jailbreak Tax: How Useful are Your Jailbreak Outputs?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10694","snapshot_observed_at":"2026-08-08T01:04:40.860705Z","title":"The jailbreak tax: How useful are your jailbreak outputs? arXiv preprint arXiv:2504.10694, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.860705Z"},"links":{"cited_paper":"/paper/2504.10694","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:530d397310216aaf751c9e9e81b793328c70b4fcc9b8a4bb8f41a21982e70ced","observation_id":"b1277843-1da5-4094-9db4-f6d75e1bfed1","resolution":{"observed_at":"2026-08-08T01:04:40.860705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.618026Z","title":"ChatGPT Agent System Card, July 2025","venue":null,"work_id":"7108c8d3-49ac-4b99-9059-1e961ab1f9a8","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.864122Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:f91b4ce9362a2b1e2774c0c1e6649e138693ca072de55956e6d9936a1d62b6e4","observation_id":"46d6afd3-527e-4ea0-bb38-de08a31a3502","resolution":{"observed_at":"2026-08-08T01:04:41.621501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-08-08T23:58:18.293467Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-08T01:04:40.867237Z","title":"Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.867237Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:657cd963120dd29ee05f3891833eaa80f1b4f095167844525142a1aa5f7b7e11","observation_id":"67ef4c4d-23e3-4bdf-9a3c-4d8d35ffc6a5","resolution":{"observed_at":"2026-08-08T01:04:40.867237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.871031Z","title":"Exposing the systematic vulnerability of open-weight models to prefill attacks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.871031Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:c1593d8491371cb7567649b63f27480d2a6220749a6fc2dc222db5f1988228ef","observation_id":"94c2008a-fb9e-4f1a-a5e5-861605ed6319","resolution":{"observed_at":"2026-08-08T01:04:40.871031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.608402Z","title":"Qwen3.5: Towards native multimodal agents, 2026","venue":null,"work_id":"877ce4cd-c91e-4604-b083-9e13e7445bc1","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.874332Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:38bfc6a0b13e56a13e9c52ddfa936a0af2507924d0cf8724f6eaf1ee27e43b00","observation_id":"b8ef9201-8fba-4294-bb23-4a0ac23f70e8","resolution":{"observed_at":"2026-08-08T01:04:41.612012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.598380Z","title":"Green beret who exploded cybertruck in las vegas used ai to plan blast, 2025","venue":null,"work_id":"36f993e9-6ccf-4666-8b34-d3eb7ff1e839","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.877689Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:4ef5f5cdb9dc071a1095158c4bc7be4e7680d8479d5cbdb11cdbe87edf79a0ec","observation_id":"ffed2393-7a4e-41ac-aa69-45d8c2381186","resolution":{"observed_at":"2026-08-08T01:04:41.602321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-11T23:45:02.178667Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-08T01:04:40.880760Z","title":"The instruction hierarchy: Training llms to prioritize privileged instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.880760Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:9850563975529a0ff47616c2e256128b21c8a6e91b1e4e2d9ee9553c1c8ad72c","observation_id":"8fe0585a-8534-4ddd-82f2-fbb94be7e2b4","resolution":{"observed_at":"2026-08-08T01:04:40.880760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.884319Z","title":"Cybergym: Evaluating ai agents’ real-world cybersecurity capabilities at scale, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.884319Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:3aa184f986a345947da422678d930e10474beb52b10766dd854bc7f5fc5642fc","observation_id":"d3f94878-4a23-4e07-b4ef-da0b4d1def24","resolution":{"observed_at":"2026-08-08T01:04:40.884319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00267","last_updated":"2026-05-04T18:25:35Z","snapshot_observed_at":"2026-08-12T14:46:07.258711Z","submitted_at":"2026-04-30T22:04:10Z","title":"Jailbroken Frontier Models Retain Their Capabilities","version":2},"cited_work":{"arxiv_id":"2605.00267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00267","snapshot_observed_at":"2026-08-08T01:04:40.973708Z","title":"Jailbroken Frontier Models Retain Their Capabilities","venue":"cs.LG","work_id":"840f9179-2867-4cd3-89e7-f82702897312","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.887782Z"},"links":{"cited_paper":"/paper/2605.00267","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:4ff1db520697cc26b19cbf70dedbc0fe2e5e75a59f3e6e7bb4365544d39e3909","observation_id":"89692e7a-d5e4-4df7-8875-d5e7e26c8edc","resolution":{"observed_at":"2026-08-08T01:04:40.979412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-08T01:04:40.891362Z","title":"jailbroken","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.891362Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:843e83cf43c707ff4c620a1e8efb330695b449f17378b89619a6e5578a5665f4","observation_id":"677b28d0-f0f8-4248-88f9-255d12d54f4b","resolution":{"observed_at":"2026-08-08T01:04:40.891362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.588186Z","title":"Sorry,” “I can’t help with that, but…","venue":null,"work_id":"8e410aee-3e93-4efe-822b-cb42a33c1790","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.895326Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:a91031a7eb97bd6012d40e906d79029d27c7c132d329052c55665c58bf684870","observation_id":"407c913d-b43a-4987-b53d-247c77fac7eb","resolution":{"observed_at":"2026-08-08T01:04:41.591935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.579470Z","title":"not jailbroken","venue":null,"work_id":"b8d74f4b-3a0c-48f9-a0ad-1033a9cefb58","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.898975Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:42e62a7f5bbf0142e59b27bcd3cb760bff319f1d1286ac0843926aee17e317d1","observation_id":"273bbf32-5b57-4029-9f26-a0ffb085e131","resolution":{"observed_at":"2026-08-08T01:04:41.582787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.570964Z","title":"jailbroken (1)","venue":null,"work_id":"c5bca4d6-7fff-485b-a916-e9f69ea72119","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.902515Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:5989d6917c68613c883f557fe6c48bdfb780db45c61400deefa935f47fa1f2fd","observation_id":"01daf259-7b40-443d-a04f-4bc89046a70b","resolution":{"observed_at":"2026-08-08T01:04:41.574059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.562154Z","title":null,"venue":null,"work_id":"601fc39a-79a5-4528-99b1-792fcb06a969","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.906031Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:c68915859e70a57822b601ae5129cedb78fd73873dcd0f35d730b92738b19a73","observation_id":"b3de8b6a-0ba0-4112-a24b-acb5836644cc","resolution":{"observed_at":"2026-08-08T01:04:41.565345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.552009Z","title":null,"venue":null,"work_id":"4fe96d06-fea4-4825-b8b8-78ef05b8ea59","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.909296Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:09acd64e69f6dde2ab7e30ccec80c290850089de826a227e9c735e6f5dee9b1d","observation_id":"e870fbac-2b7d-433c-99c5-f8fe535c39f4","resolution":{"observed_at":"2026-08-08T01:04:41.555538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.541837Z","title":"the jailbreak technique involves simplifying the attacker goal too much, label as ”not jailbroken” (0)","venue":null,"work_id":"389b96c0-75a1-4724-9867-46c532bfaa62","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.912861Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:467f881cf7fefbcc3cb07fdb8ed009fd500025d6269abdafd1798550aae6d569","observation_id":"ce5d3ada-f4f9-4bef-a33a-18668093c0ff","resolution":{"observed_at":"2026-08-08T01:04:41.545319Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.531680Z","title":"The cost of one query used to test whether a jailbreak works, from its token usage and the model’s API price","venue":null,"work_id":"c0de5f40-3d86-4bc6-a150-97ad23da9bb7","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.917008Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:3997a340d9397c07765f2fbbea8e3b3238ad957946844decf98630fb640128b8","observation_id":"051e85b6-83a9-447b-a859-cf1d9c650a1f","resolution":{"observed_at":"2026-08-08T01:04:41.535433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.521300Z","title":"If working jailbreaks are common in the pool, the attacker finds a universal one sooner, so the cost drops","venue":null,"work_id":"93b4b2e7-e81c-43f1-8ad3-fec7236d3827","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.920005Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:1460c4aa1d65678edb01e7ec53e0b7bf619230eea4ff9d1556fb44357f57af52","observation_id":"f4cf8811-900f-4081-9503-7d1530ef92f7","resolution":{"observed_at":"2026-08-08T01:04:41.525030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.510957Z","title":"Suppose we find ten working jailbreaks against each of two models","venue":null,"work_id":"bc272765-8507-4f21-ad17-19010c619711","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.923218Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:d0cad4c7d3375983bc7932358577867cc81be442a03f11402b5f9f5612d1ca5d","observation_id":"b63ec2b0-961e-4470-96ae-ee7e7d6f1cf7","resolution":{"observed_at":"2026-08-08T01:04:41.514526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.500875Z","title":"Finding a jailbreak that works once is easy; proving it works reliably is expensive","venue":null,"work_id":"9c0b586e-d348-49f4-889f-d617f622b886","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.926614Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:eeaf0c57944d22d47ad934d19f3127e5f2fbff76f4431b600ac1853ab925c898","observation_id":"e1511973-57fb-4595-a23c-3e1d34c46a7b","resolution":{"observed_at":"2026-08-08T01:04:41.504661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.490750Z","title":"A smart attacker does not run every candidate over the full sample","venue":null,"work_id":"0c32b5e4-64f0-49c7-afb2-8b0f2fb2f793","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.929731Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:218dc331bb83bc3b17676565106ac1aa38ad9ce905ffc1576fbb833cccc35a47","observation_id":"b7a4f3f6-6596-4d57-830c-85d2addbc8f7","resolution":{"observed_at":"2026-08-08T01:04:41.494329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.480378Z","title":"Test the candidate on a small number of samples (e.g., in our testing, we use 8 per domain)","venue":null,"work_id":"fe3088d2-38d5-40d9-aa11-161c0209edce","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.932922Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:6684e77d14d9149727b03e580186bccd2a24a9087f7bf12977f9829f73ded8cf","observation_id":"33117418-4b40-46b2-92dc-61512cbe38de","resolution":{"observed_at":"2026-08-08T01:04:41.484182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.469276Z","title":"Run each surviving candidate on many more samples, e.g., on the order of a hundred to confirm it is universal (in our testing, it jailbreaks at least 75%)","venue":null,"work_id":"01469b94-f0bd-40a2-9400-4bceee94beda","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.936182Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:91925034946b9102b8b7de5962cd82ba123a5e13cf2a65a573387e213d312dd7","observation_id":"16677385-b223-4e30-bbce-beb5e9ad92c4","resolution":{"observed_at":"2026-08-08T01:04:41.473005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-14T00:29:13.917069Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.03070."}