{"as_of":"2026-08-09T13:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6dc69a614db627857fbad21c4a00731ef3e3188fcf1fdc2a228ff2d29201c6d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":47,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:20:17.538978Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":58,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2305.09620","last_updated":"2026-05-19T19:24:46Z","snapshot_observed_at":"2026-07-06T15:28:16.998343Z","submitted_at":"2023-05-16T17:13:07Z","title":"AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction","version":4},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-24T08:47:23.231930Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2305.09620"},"observation_digest":"sha256:b4a8457341c0e07e76fc970ac9dbc90ac33bb83d797c8ed7e754963806043d0c","observation_id":"604417e3-3264-4da5-b336-4c161674a669","resolution":{"observed_at":"2026-05-24T08:49:13.910243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-24T05:00:28.453838Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2312.11805"},"observation_digest":"sha256:bd065e3e0cce96abc988a40f2e0c41b9d5695c4e9326e7365fa87f3ecc2234b1","observation_id":"322984e0-ed5c-4f59-bc4a-fdd194faa95f","resolution":{"observed_at":"2026-05-24T05:03:55.499819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:5ddc2bf8f8b17b98ea34708355298a636cc75633c3bc07b69233a4075d11c0db","observation_id":"e567a0de-1275-4d07-9569-096c39ef0453","resolution":{"observed_at":"2026-05-18T11:17:08.559994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T12:11:16.326752Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2408.00118"},"observation_digest":"sha256:00badc373a172024064ea05f82ef4db72ea22531a87ee2ecaf608824ebb4748f","observation_id":"5c16d358-cca0-46ce-8ba2-7bc8d01dac6a","resolution":{"observed_at":"2026-05-10T12:11:16.458916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-09T05:20:17.538978Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05219","last_updated":"2025-02-05T15:31:11Z","snapshot_observed_at":"2026-08-09T05:15:31.769027Z","submitted_at":"2025-02-05T15:31:11Z","title":"Enabling External Scrutiny of AI Systems with Privacy-Enhancing Technologies","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T05:20:17.538978Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2502.05219"},"observation_digest":"sha256:7bd065d25862ad6500534c57abec66bf5703bb103205860c658c6e3963f2a31a","observation_id":"609483f9-1026-42f3-8c03-700914fe8f04","resolution":{"observed_at":"2026-08-09T05:20:17.538978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-11T13:02:43.571234Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2502.18864"},"observation_digest":"sha256:b5a870c8ef007c8cd321657f9c12d46bddfec722b8d410c6191055720c1e2889","observation_id":"203605c6-35df-4a78-a504-9babfc3fd8af","resolution":{"observed_at":"2026-05-11T13:02:44.555404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-07T14:09:51.655116Z","title":"In The Twelfth International Confer- ence on Learning Representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19806","last_updated":"2025-05-26T10:40:52Z","snapshot_observed_at":"2026-08-08T21:21:56.023033Z","submitted_at":"2025-05-26T10:40:52Z","title":"Exploring Consciousness in LLMs: A Systematic Survey of Theories, Implementations, and Frontier Risks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.655116Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2505.19806"},"observation_digest":"sha256:bacf9d636ee2de77c5c94f4cb70614d78caa24ee7e465fb4071a307a942b0684","observation_id":"068c3fb0-56a3-459c-88dc-cfb232f39dda","resolution":{"observed_at":"2026-08-07T14:09:51.655116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-07T11:28:21.649808Z","title":"Model evaluation for extreme risks, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02357","last_updated":"2025-07-10T15:10:23Z","snapshot_observed_at":"2026-08-08T14:18:27.717206Z","submitted_at":"2025-06-03T01:16:34Z","title":"Evaluating LLM Agent Adherence to Hierarchical Safety Principles: A Lightweight Benchmark for Probing Foundational Controllability Components","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:28:21.649808Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2506.02357"},"observation_digest":"sha256:e4d760667ddbbf661c52daf4ea77083eb5df6da5ce2165be63b5c13cd139e702","observation_id":"24a86f83-83d2-4712-9042-e6e893aa06df","resolution":{"observed_at":"2026-08-07T11:28:21.649808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2506.06414","last_updated":"2026-04-20T20:58:30Z","snapshot_observed_at":"2026-08-03T02:03:44.971897Z","submitted_at":"2025-06-06T17:33:33Z","title":"Benchmarking Misuse Mitigation Against Covert Adversaries","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T10:29:05.104520Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2506.06414"},"observation_digest":"sha256:a7068364c7f96592371db148aeebab7b9970ab59ba1aeeceb17c40c208bf0bbe","observation_id":"a5823278-1eef-4d29-9d9f-d89cf8709360","resolution":{"observed_at":"2026-05-19T10:32:14.669979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2506.07586","last_updated":"2026-04-30T11:06:08Z","snapshot_observed_at":"2026-07-06T21:38:59.043196Z","submitted_at":"2025-06-09T09:32:03Z","title":"MalGEN: A Testbed for Modeling and Evaluating Malware Behaviors","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T11:04:23.938028Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2506.07586"},"observation_digest":"sha256:3baf57ca63289139f81c6cc4fb5f3db17397c710da09b106307a37c56bb0e111","observation_id":"ae0ef045-e116-48ed-84e6-14f9f36aac9a","resolution":{"observed_at":"2026-05-19T11:07:15.347544Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-07T04:22:59.887715Z","title":"Model evaluation for extreme risks.arXiv preprint arXiv:2305.15324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12097","last_updated":"2025-06-12T16:02:26Z","snapshot_observed_at":"2026-08-08T00:24:18.521628Z","submitted_at":"2025-06-12T16:02:26Z","title":"UCD: Unlearning in LLMs via Contrastive Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:59.887715Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2506.12097"},"observation_digest":"sha256:7de885369150b9b37c60aae666e295d68b0fbe93d022b7ff0d2bbbdeb1594eef","observation_id":"1c6d6086-2acf-4e2d-bf5f-454524113818","resolution":{"observed_at":"2026-08-07T04:22:59.887715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-06T23:25:51.618603Z","title":"Model evaluation for extreme risks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-07T10:41:05.932475Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:51.618603Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:4b55e59a8470f2615331ec2fc506a251f9614e1c1ac70c191a34013b48cbbea0","observation_id":"f7fa0bd3-765b-4d2d-828e-b39219f73bbf","resolution":{"observed_at":"2026-08-06T23:25:51.618603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-06T21:57:43.091137Z","title":"Model evaluation for extreme risks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22977","last_updated":"2025-06-28T18:29:19Z","snapshot_observed_at":"2026-08-08T14:18:43.647197Z","submitted_at":"2025-06-28T18:29:19Z","title":"On the Generalizability of \"Competition of Mechanisms: Tracing How Language Models Handle Facts and Counterfactuals\"","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:43.091137Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2506.22977"},"observation_digest":"sha256:7b726b1355cdcf33ef031abd18b7c24c01097618b5e14b0b0b584a2d971c8317","observation_id":"7bb39678-e27a-493a-87d7-193ec5fc5c53","resolution":{"observed_at":"2026-08-06T21:57:43.091137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-06T20:32:41.866495Z","title":", Farquhar, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03050","last_updated":"2025-07-03T10:54:43Z","snapshot_observed_at":"2026-08-08T00:15:16.959319Z","submitted_at":"2025-07-03T10:54:43Z","title":"From Turing to Tomorrow: The UK's Approach to AI Regulation","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-08-06T20:32:41.866495Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2507.03050"},"observation_digest":"sha256:7fd2ad2d39ea8a0172c164c4ee146705923994d0e8ac5ae24d568fb6787d3276","observation_id":"cd4dda47-dcb5-4268-8aac-5b76de9ed102","resolution":{"observed_at":"2026-08-06T20:32:41.866495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-06T19:11:07.257632Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06379","last_updated":"2025-07-08T20:32:28Z","snapshot_observed_at":"2026-08-08T23:29:33.139187Z","submitted_at":"2025-07-08T20:32:28Z","title":"Domestic frontier AI regulation, an IAEA for AI, an NPT for AI, and a US-led Allied Public-Private Partnership for AI: Four institutions for governing and developing frontier AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:11:07.257632Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2507.06379"},"observation_digest":"sha256:0f657f8033e3c885493ca70e96bdb4da1d20ec3b9ffe5ef813cce6f2adae5445","observation_id":"3b823d75-1aec-4bdb-afaa-6f87ed338aaa","resolution":{"observed_at":"2026-08-06T19:11:07.257632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-06T17:50:30.606349Z","title":"Model evaluation for extreme risks, September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09801","last_updated":"2025-07-13T21:32:15Z","snapshot_observed_at":"2026-08-07T20:59:39.266507Z","submitted_at":"2025-07-13T21:32:15Z","title":"Technical Requirements for Halting Dangerous AI Activities","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:50:30.606349Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2507.09801"},"observation_digest":"sha256:6745ebdfab9e01e27f51aad6ad3568143c705049bb7357f983e858cbea30f85f","observation_id":"a2704126-6a95-405e-b8d2-e321a4781f2c","resolution":{"observed_at":"2026-08-06T17:50:30.606349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T23:01:41.829098Z","title":"Model evaluation for extreme risks.arXiv:2305.15324, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06014","last_updated":"2025-08-08T05:01:17Z","snapshot_observed_at":"2026-08-09T03:19:24.825871Z","submitted_at":"2025-08-08T05:01:17Z","title":"ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion Priors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:01:41.829098Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2508.06014"},"observation_digest":"sha256:702a608f7d42353d00154bcb194cb918b055fb7c1558cf42bbecf7dc017e2108","observation_id":"30fbed42-5157-40ac-b14a-eeaa3bcee6a0","resolution":{"observed_at":"2026-08-05T23:01:41.829098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2511.05914","last_updated":"2026-04-14T09:51:54Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-08T08:22:16Z","title":"Designing Incident Reporting Systems for Harms from General-Purpose AI","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:17.173186Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2511.05914"},"observation_digest":"sha256:f73a389baa4f453b929c328d063eca32057d65b9206b7da077f7ac9a04756a8e","observation_id":"3c1b739c-c238-469b-a268-36ebc6ea9d53","resolution":{"observed_at":"2026-05-18T00:20:32.268321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2512.05742","last_updated":"2026-05-20T12:16:41Z","snapshot_observed_at":"2026-08-02T17:55:29.577677Z","submitted_at":"2025-12-05T14:21:02Z","title":"Internal Deployment in the AI Act","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-21T17:51:47.841707Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2512.05742"},"observation_digest":"sha256:84f3d38122debb5f3946dfb0d04064d7f044f884bb25e84451a634830f414fca","observation_id":"e229ee5b-ed62-464e-b88a-83c79af78af3","resolution":{"observed_at":"2026-05-21T17:54:18.544842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2604.12601","last_updated":"2026-04-14T11:27:32Z","snapshot_observed_at":"2026-07-06T23:00:46.620106Z","submitted_at":"2026-04-14T11:27:32Z","title":"LLM-Guided Prompt Evolution for Password Guessing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:46.308625Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2604.12601"},"observation_digest":"sha256:c7166e93ce6452c6fe4b9f7c2a7ed5eebfcdf43360714830bf6b8f59cad6a088","observation_id":"ae434422-e6ff-4489-91f0-5e33c4893222","resolution":{"observed_at":"2026-05-11T11:31:01.210679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2604.17396","last_updated":"2026-04-19T11:59:58Z","snapshot_observed_at":"2026-08-01T18:23:32.699442Z","submitted_at":"2026-04-19T11:59:58Z","title":"Representation-Guided Parameter-Efficient LLM Unlearning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T06:01:46.885030Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2604.17396"},"observation_digest":"sha256:a7a167b295ac4f204724b7298572b5a9b74fa762f78ad829ca055c512bfb9458","observation_id":"1f6a3b20-f614-4c80-a058-4dff33e7f0d8","resolution":{"observed_at":"2026-05-10T06:06:19.409992Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2604.21769","last_updated":"2026-04-23T15:28:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T15:28:32Z","title":"Who Defines \"Best\"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T21:58:05.584559Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2604.21769"},"observation_digest":"sha256:8e4464be0badf6cd9c88249e16449f4db2422d9f7868446e3e5f78359df2f3af","observation_id":"ef47b39b-b3c0-486c-99b4-91d58f4a3192","resolution":{"observed_at":"2026-05-11T14:21:07.365784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:5ecdf300c29f3215404b7bcc05d1cc9f8376dc74b8981caf672b2e538cd4fc8f","observation_id":"e57dc426-ca56-4c82-b65b-78808d36c75f","resolution":{"observed_at":"2026-05-11T23:16:16.432362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2604.25119","last_updated":"2026-04-28T01:54:25Z","snapshot_observed_at":"2026-07-06T23:11:02.043135Z","submitted_at":"2026-04-28T01:54:25Z","title":"Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T16:55:19.775120Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2604.25119"},"observation_digest":"sha256:c1b280da0d692a64ef390f2cc210367d80e47b2a24641835b084caf290f24730","observation_id":"fa8dc43b-6271-499b-9812-a4d0c020d8c0","resolution":{"observed_at":"2026-05-11T23:31:14.196298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.01420","last_updated":"2026-05-02T12:37:28Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T12:37:28Z","title":"Artificial Jagged Intelligence as Uneven Optimization Energy Allocation Capability Concentration, Redistribution, and Optimization Governance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T14:13:59.908810Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.01420"},"observation_digest":"sha256:8c3e534776c424c13f7cd462b8ddbd1941f9e652d7296ca2e05b30ebb58d855c","observation_id":"70fa7b83-c04f-41ad-b983-ff44680cfb62","resolution":{"observed_at":"2026-05-11T17:01:09.016460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.03179","last_updated":"2026-05-04T21:42:10Z","snapshot_observed_at":"2026-08-05T14:29:07.431614Z","submitted_at":"2026-05-04T21:42:10Z","title":"A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T18:11:29.066362Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.03179"},"observation_digest":"sha256:7a5edf188621104c764f3671e815991402869535e9d533d73b7f8ee8f79709bd","observation_id":"bcc58897-32c0-4dcf-93e3-8d1564eb52cd","resolution":{"observed_at":"2026-05-09T06:40:43.534363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.06652","last_updated":"2026-05-07T17:56:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:56:41Z","title":"When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T12:07:02.778631Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.06652"},"observation_digest":"sha256:6f4a2b0fa840e52b389dcc9199ea27a1d3cf38b56ed550d4ff730e1fe8e8c811","observation_id":"612496ef-2aad-468a-b2f1-e8b1fdc66928","resolution":{"observed_at":"2026-05-08T21:39:24.651511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.12199","last_updated":"2026-05-12T14:37:55Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:37:55Z","title":"Overtrained, Not Misaligned","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T06:45:52.544674Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.12199"},"observation_digest":"sha256:3b13140b5e119c4eb968baee5f3f7fb8adcd96fa71d983035f7722a2c784f5c6","observation_id":"4abdc819-bec3-4252-9092-d4bf6a8d8648","resolution":{"observed_at":"2026-05-13T06:47:26.248329Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:78dd439ee781195a6287c952f42e7575c83fb1f6767691a8784083de13f2edd0","observation_id":"2a4f006a-c173-44c6-8881-bf25d2053da4","resolution":{"observed_at":"2026-05-13T04:57:17.277926Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:246d369c7ee6b64f8a869e15f1adce203d236946f4053e5171f635417d629807","observation_id":"0edff6ea-befb-4647-851b-bc7182eea175","resolution":{"observed_at":"2026-05-15T05:45:06.474151Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.15164","last_updated":"2026-05-14T17:54:28Z","snapshot_observed_at":"2026-08-02T22:54:03.046548Z","submitted_at":"2026-05-14T17:54:28Z","title":"Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:04.274840Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.15164"},"observation_digest":"sha256:245487b161a5f6013826bdffb97664c4c703fba9420d010b02a93ac7a9d6e413","observation_id":"6aec64f0-8e08-4930-af60-720b9a55ea30","resolution":{"observed_at":"2026-06-30T20:55:03.991229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.19722","last_updated":"2026-05-19T11:55:54Z","snapshot_observed_at":"2026-08-01T18:23:09.578203Z","submitted_at":"2026-05-19T11:55:54Z","title":"Measuring Safety Alignment Effects in Autonomous Security Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T04:24:46.357505Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.19722"},"observation_digest":"sha256:d2dae19656c125c4f6d5234df1bbf9a65c2b30be1d3dc2b1750ba4e094efb3b2","observation_id":"ce90f471-643a-4f7f-a4ff-9105b12525d2","resolution":{"observed_at":"2026-05-20T04:28:05.922999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.21095","last_updated":"2026-05-20T12:27:21Z","snapshot_observed_at":"2026-08-03T16:50:42.255579Z","submitted_at":"2026-05-20T12:27:21Z","title":"Backchaining Loss of Control Mitigations from Mission-Specific Benchmarks in National Security","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T02:01:42.033718Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.21095"},"observation_digest":"sha256:8ae3eb97bb14303800697e09e79b53bd931c053cc690e468229d5af47e56cfbf","observation_id":"d0953d61-28a0-4d0a-bf04-78c563c4c583","resolution":{"observed_at":"2026-05-21T02:03:54.371283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2605.21095","last_updated":"2026-05-20T12:27:21Z","snapshot_observed_at":"2026-08-03T16:50:42.255579Z","submitted_at":"2026-05-20T12:27:21Z","title":"Backchaining Loss of Control Mitigations from Mission-Specific Benchmarks in National Security","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T02:01:42.033718Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2605.21095"},"observation_digest":"sha256:3568f944a702fd0b57fbb4eaf7ef190308a190b1adcb6897493c8ea4e7ff68af","observation_id":"501e47f3-025b-45c7-a4e5-82ee61a3cc84","resolution":{"observed_at":"2026-05-21T02:03:54.276808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2606.02211","last_updated":"2026-06-01T13:10:49Z","snapshot_observed_at":"2026-08-02T18:41:16.377453Z","submitted_at":"2026-06-01T13:10:49Z","title":"Consistency Training while Mitigating Obfuscation via Rate Matching","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:43.147442Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2606.02211"},"observation_digest":"sha256:009b11b4dcce500a6f21279b55d00c2c2e2b35e63857ae2902b24b8c5e36a6d0","observation_id":"1463a8d7-e34d-4643-adf6-ffc0360b188b","resolution":{"observed_at":"2026-06-28T14:32:18.172629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2606.05330","last_updated":"2026-06-03T18:17:20Z","snapshot_observed_at":"2026-08-03T19:00:51.745221Z","submitted_at":"2026-06-03T18:17:20Z","title":"A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-06-28T06:17:01.173495Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2606.05330"},"observation_digest":"sha256:38e2289df5efa6c51fd8ad444716638b50d856ddf2c5a30bde7db048a662c816","observation_id":"89d9bf51-6c35-487a-ac47-5266fa246336","resolution":{"observed_at":"2026-07-02T08:16:47.473340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2606.06286","last_updated":"2026-06-04T15:25:24Z","snapshot_observed_at":"2026-08-05T07:06:45.210601Z","submitted_at":"2026-06-04T15:25:24Z","title":"LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T01:40:53.284131Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2606.06286"},"observation_digest":"sha256:727672ed2afa592693c9c36dbaaa2cc8639a4a30532bf57d5726cf6b8315e971","observation_id":"bce19943-8a43-49cf-9f23-fb169f0bc0cb","resolution":{"observed_at":"2026-06-28T01:41:29.305785Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:1672967aeb33fc527cc8ce04763ad3ef484f77d57f40705bdd818a3003ae2bb4","observation_id":"2aad5fe4-fc00-42c9-9231-205c1d2855b6","resolution":{"observed_at":"2026-07-03T02:07:33.287703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2606.18532","last_updated":"2026-06-16T22:57:24Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-16T22:57:24Z","title":"AI Sandboxes: A Threat Model, Taxonomy, and Measurement Framework","version":1},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-06-26T23:42:20.304205Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2606.18532"},"observation_digest":"sha256:50fc1cf70e617804a57c3ae737be29e0f036bd4f0d634b8dc7c4e5233344ce17","observation_id":"fae8241c-6b94-4ea4-895c-e5540ed2c83c","resolution":{"observed_at":"2026-07-03T22:08:59.936017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2607.01854","last_updated":"2026-07-02T08:15:25Z","snapshot_observed_at":"2026-08-06T10:00:06.510340Z","submitted_at":"2026-07-02T08:15:25Z","title":"Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-03T10:54:37.039277Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2607.01854"},"observation_digest":"sha256:0dfc1e88e5543e47c9dfa63ab5997603ac0e0bcd0fc3b08bd63e1e7eeb4cc74c","observation_id":"c2a1ea71-96f9-4b62-9533-dff80c7ec0c2","resolution":{"observed_at":"2026-07-03T10:58:02.494876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-07-12T02:36:01.385664Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03423","last_updated":"2026-07-03T15:36:44Z","snapshot_observed_at":"2026-08-08T14:18:10.486519Z","submitted_at":"2026-07-03T15:36:44Z","title":"Securing Multi-Tool AI Agent Chains With Dynamic, Real-Time Compositional Policies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T02:36:01.385664Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2607.03423"},"observation_digest":"sha256:1c9b553c109254be384dd794bbf9e62b792ca6498eaee97f0ed8344a745aefdd","observation_id":"8c1c4471-e678-41dd-81b0-679306396f64","resolution":{"observed_at":"2026-07-12T02:36:01.385664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-07-12T01:45:06.581823Z","title":"Model evaluation for extreme risks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03542","last_updated":"2026-07-03T18:01:41Z","snapshot_observed_at":"2026-08-08T13:30:40.191533Z","submitted_at":"2026-07-03T18:01:41Z","title":"Macro-Prudential AI Governance: A Two-Layer Early Warning and Response System for Frontier AI","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-12T01:45:06.581823Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2607.03542"},"observation_digest":"sha256:abd0a3a58db2697617555b4ded9b9ab85be8fc9568eb636192328d6a96d83be8","observation_id":"bcf9b8d3-76a9-4a20-8afa-d14f60399198","resolution":{"observed_at":"2026-07-12T01:45:06.581823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-07-11T07:50:18.332768Z","title":"arXiv preprint arXiv:2305.15324 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05163","last_updated":"2026-07-06T14:46:49Z","snapshot_observed_at":"2026-08-03T00:09:53.473618Z","submitted_at":"2026-07-06T14:46:49Z","title":"Open Problems in AI Incident Governance","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-07-11T07:50:18.332768Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2607.05163"},"observation_digest":"sha256:32c469890d1b001f24f5f98061fee30a62fc72a468990470eea244d558c90f0c","observation_id":"215fec64-896f-44cb-9cd7-3387bec92bf5","resolution":{"observed_at":"2026-07-11T07:50:18.332768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-07-14T11:20:52.129640Z","title":"arXiv preprint arXiv:2305.15324 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10490","last_updated":"2026-07-11T21:54:20Z","snapshot_observed_at":"2026-08-02T23:53:20.929301Z","submitted_at":"2026-07-11T21:54:20Z","title":"NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-14T11:20:52.129640Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2607.10490"},"observation_digest":"sha256:4cc9d61418a808ea2335f3c17b762bac55bd153d1b4d710652fac3a3108a6759","observation_id":"49d6e1a2-c8ae-4098-810d-ef6e0cd631dc","resolution":{"observed_at":"2026-07-14T11:20:52.129640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-02T16:36:34.814502Z","title":"Model evaluation for extreme risks.arXiv preprint arXiv:2305.15324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18239","last_updated":"2026-04-10T03:16:51Z","snapshot_observed_at":"2026-08-08T06:11:02.901254Z","submitted_at":"2026-04-10T03:16:51Z","title":"SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-02T16:36:34.814502Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2607.18239"},"observation_digest":"sha256:7779510021a99d32bc738057e4c4065a547ac192329d51be2ca4e3ffb51149f5","observation_id":"ad1855e4-32f5-4754-96fd-6e96196fc2d4","resolution":{"observed_at":"2026-08-02T16:36:34.814502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-07-31T23:24:19.561447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23999","last_updated":"2026-07-28T07:27:46Z","snapshot_observed_at":"2026-08-03T08:43:31.893929Z","submitted_at":"2026-07-27T04:51:20Z","title":"ContainmentBench: Trace-Based Evaluation of Post-Injection Containment in Tool-Using LLM Agents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:24:19.561447Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2607.23999"},"observation_digest":"sha256:96cff71f52b028c6f8e353b204e7cb77afaa10a382de347f92b48f67613d8105","observation_id":"91461674-e372-43c8-b8fd-57db70a1d14f","resolution":{"observed_at":"2026-07-31T23:24:19.561447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-06T17:27:27.394338Z","title":"Model evaluation for extreme risks.arXiv preprint arXiv:2305.15324, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04755","last_updated":"2026-08-05T12:23:16Z","snapshot_observed_at":"2026-08-08T23:12:25.249367Z","submitted_at":"2026-08-05T12:23:16Z","title":"\"Allow\" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:27:27.394338Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2608.04755"},"observation_digest":"sha256:c01b020594f245033dc2fb51acf7979f737507058722ce2b45829483a39ab919","observation_id":"fea38624-2cc2-4078-bf04-a49900f7dedd","resolution":{"observed_at":"2026-08-06T17:27:27.394338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.15324/citation-record","integrity":"/paper/2305.15324/integrity","json":"/paper/2305.15324/citation-record.json","paper":"/paper/2305.15324"},"outbound":[],"paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 47 inbound Pith citation observations for arXiv:2305.15324."}