{"as_of":"2026-08-13T18:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:799ee961f73904689b9e69ff399746aff73524af254aa87e41dc7cd54f29e0eb","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:56:21.102873Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T09:01:07.210356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"cited_work":{"arxiv_id":"2412.08653","doi":"10.48550/arxiv.2412.08653","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","venue":"arXiv (Cornell University)","work_id":"e4ad0ab9-9797-45b5-b0d3-f26293a78a03","year":2024},"citing_paper":{"arxiv_id":"2604.14070","last_updated":"2026-04-15T16:39:28Z","snapshot_observed_at":"2026-08-12T23:56:30.875194Z","submitted_at":"2026-04-15T16:39:28Z","title":"From Disclosure to Self-Referential Opacity: Six Dimensions of Strain in Current AI Governance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T11:55:50.822764Z"},"links":{"cited_paper":"/paper/2412.08653","citing_paper":"/paper/2604.14070"},"observation_digest":"sha256:c7203544967b8cde33a44e04a92df05ed0a5312882ca2b589979562702767bad","observation_id":"8f23a12e-520b-4ff7-b021-a0d8eb82b270","resolution":{"observed_at":"2026-05-10T12:00:22.254888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"cited_work":{"arxiv_id":"2412.08653","doi":"10.48550/arxiv.2412.08653","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","venue":"arXiv (Cornell University)","work_id":"e4ad0ab9-9797-45b5-b0d3-f26293a78a03","year":2024},"citing_paper":{"arxiv_id":"2606.08529","last_updated":"2026-06-07T09:14:16Z","snapshot_observed_at":"2026-08-11T23:52:47.253697Z","submitted_at":"2026-06-07T09:14:16Z","title":"Scaffold Effects on GAIA: A Controlled Comparison","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:26:58.469351Z"},"links":{"cited_paper":"/paper/2412.08653","citing_paper":"/paper/2606.08529"},"observation_digest":"sha256:5c30c19d893b90a50ff60e59597c65d97e386c2f65a307f6e0ddb51c6dd6d33f","observation_id":"c9e9d58b-a850-459d-9472-b294307149e7","resolution":{"observed_at":"2026-07-02T23:07:27.088498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"cited_work":{"arxiv_id":"2412.08653","doi":"10.48550/arxiv.2412.08653","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","venue":"arXiv (Cornell University)","work_id":"e4ad0ab9-9797-45b5-b0d3-f26293a78a03","year":2024},"citing_paper":{"arxiv_id":"2606.28694","last_updated":"2026-06-27T02:27:55Z","snapshot_observed_at":"2026-07-07T00:02:43.396508Z","submitted_at":"2026-06-27T02:27:55Z","title":"Verifying Restrictions on Frontier AI Research","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T09:01:07.210356Z"},"links":{"cited_paper":"/paper/2412.08653","citing_paper":"/paper/2606.28694"},"observation_digest":"sha256:7a3038c29904d1d583795cf5fd1cd193621fd121a05228e099fbaf1ebacb2569","observation_id":"7629eaf4-63ee-48b1-8620-7afde37db9c6","resolution":{"observed_at":"2026-06-30T09:04:32.211462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08653/citation-record","integrity":"/paper/2412.08653/integrity","json":"/paper/2412.08653/citation-record.json","paper":"/paper/2412.08653"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.12820","last_updated":"2024-11-19T19:13:56Z","snapshot_observed_at":"2026-08-13T05:01:34.513529Z","submitted_at":"2024-11-19T19:13:56Z","title":"Declare and Justify: Explicit assumptions in AI evaluations are necessary for effective regulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12820","snapshot_observed_at":"2026-08-12T11:56:20.959799Z","title":"Declare and justify: Explicit assumptions in ai evaluations are necessary for effective regulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.959799Z"},"links":{"cited_paper":"/paper/2411.12820","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:b7db19418843ada5c7b533c0c3530ba85d01b83f2d38f176c72151dfb5fba266","observation_id":"7468784d-5e67-48ad-aee4-9c0c36b67029","resolution":{"observed_at":"2026-08-12T11:56:20.959799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10462","last_updated":"2024-03-18T18:11:46Z","snapshot_observed_at":"2026-08-13T00:53:14.713418Z","submitted_at":"2024-03-15T16:53:13Z","title":"Safety Cases: How to Justify the Safety of Advanced AI Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10462","snapshot_observed_at":"2026-08-12T11:56:20.965769Z","title":"Safety Cases: How to Justify the Safety of Advanced AI Systems, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.965769Z"},"links":{"cited_paper":"/paper/2403.10462","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:a6852b5dc57c39c01a392af43599dfdc83645d1dfb140b739618919506794922","observation_id":"4c07cfaa-96fd-4d42-82f1-afecfaf2b215","resolution":{"observed_at":"2026-08-12T11:56:20.965769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08088","last_updated":"2024-11-12T18:45:08Z","snapshot_observed_at":"2026-08-13T05:18:46.329173Z","submitted_at":"2024-11-12T18:45:08Z","title":"Safety case template for frontier AI: A cyber inability argument","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08088","snapshot_observed_at":"2026-08-12T11:56:20.970943Z","title":"Safety case template for frontier ai: A cyber inability argument","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.970943Z"},"links":{"cited_paper":"/paper/2411.08088","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:684b3b922c0fe4dedcb43d981455cd16584b00d742628992da511fdb04cf316e","observation_id":"bc3b5182-caf2-481a-8daa-223e31c20c3e","resolution":{"observed_at":"2026-08-12T11:56:20.970943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.572863Z","title":"Anthropic’s Responsible Scaling Policy Version 1.0, 2023","venue":null,"work_id":"60ae9eb2-436a-4eeb-901b-961170fce8e4","year":2023},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.976513Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:d2886ed542673fa7ce5a73368bf6a43c3ca04d1b50889a126ec359ce58b048c6","observation_id":"c19967bf-392a-4674-a7af-9dbf3aee01c5","resolution":{"observed_at":"2026-08-12T11:56:21.577496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.557457Z","title":"Preparedness Framework (Beta), 2023","venue":null,"work_id":"2e74168b-5ff8-4278-96b8-37af5e6a1e30","year":2023},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.981314Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:977d052b357d0d81ec701b7b63f965ca0091377599966a3bc2fd2941e2977303","observation_id":"817b2439-fa05-4b40-b1e5-e808212ae3f6","resolution":{"observed_at":"2026-08-12T11:56:21.562724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.541934Z","title":"Frontier Safety Framework, 2024","venue":null,"work_id":"61da672f-e6ab-4f8c-9043-a430795ff8dd","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.986041Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:d322f657359dc9453fc0a6b6aa343b7cab0ce22f502760be12bb91376367a378","observation_id":"e81ae6be-27ad-4d7b-9c40-76a12851e49a","resolution":{"observed_at":"2026-08-12T11:56:21.546647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13793","last_updated":"2024-04-05T12:26:11Z","snapshot_observed_at":"2026-08-13T05:18:14.368799Z","submitted_at":"2024-03-20T17:54:26Z","title":"Evaluating Frontier Models for Dangerous Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13793","snapshot_observed_at":"2026-08-12T11:56:20.991463Z","title":"Evaluating Frontier Models for Dangerous Capabilities, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.991463Z"},"links":{"cited_paper":"/paper/2403.13793","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:4dff71baa12158b09a4e830baec83fb9f113099f43fb06f70de41fa85811f948","observation_id":"d7d3fc15-ed60-4b0e-984f-dca0c53661e7","resolution":{"observed_at":"2026-08-12T11:56:20.991463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06664","last_updated":"2024-02-16T04:02:51Z","snapshot_observed_at":"2026-08-13T04:25:07.273529Z","submitted_at":"2024-02-06T14:46:08Z","title":"LLM Agents can Autonomously Hack Websites","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06664","snapshot_observed_at":"2026-08-12T11:56:20.996657Z","title":"Llm agents can autonomously hack websites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:20.996657Z"},"links":{"cited_paper":"/paper/2402.06664","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:5abc0486dbf6d3a4d31d6ed8f5106aa121c1b5db4f1ae356b610bd335d37af62","observation_id":"ba8390aa-6224-4285-90d1-2c691ef4fdf2","resolution":{"observed_at":"2026-08-12T11:56:20.996657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-12T18:31:19.542322Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08144","snapshot_observed_at":"2026-08-12T11:56:21.001715Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.001715Z"},"links":{"cited_paper":"/paper/2404.08144","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:ee947d50375c9dde21469d0bc22e3fd31a4a738a75d15871932716aaa867c256","observation_id":"e9a0ca4c-7e19-4ec5-af0f-07ede74845fd","resolution":{"observed_at":"2026-08-12T11:56:21.001715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01637","last_updated":"2025-03-30T00:26:48Z","snapshot_observed_at":"2026-08-12T23:52:08.967716Z","submitted_at":"2024-06-02T16:25:26Z","title":"Teams of LLM Agents can Exploit Zero-Day Vulnerabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01637","snapshot_observed_at":"2026-08-12T11:56:21.006726Z","title":"Teams of LLM Agents can Exploit Zero-Day Vulnerabilities, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.006726Z"},"links":{"cited_paper":"/paper/2406.01637","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:e58eceff4702641f7b341b0b2e13ed5f04fbe4686a2f0aebf056a4d622d5a0b6","observation_id":"8630ca99-e29e-44ea-960c-c5679d8e56af","resolution":{"observed_at":"2026-08-12T11:56:21.006726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14380","last_updated":"2024-03-21T13:14:40Z","snapshot_observed_at":"2026-08-13T05:01:31.988434Z","submitted_at":"2024-03-21T13:14:40Z","title":"On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14380","snapshot_observed_at":"2026-08-12T11:56:21.012376Z","title":"On the Conversa- tional Persuasiveness of Large Language Models: A Randomized Controlled Trial, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.012376Z"},"links":{"cited_paper":"/paper/2403.14380","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:e5701d61d098761b59cc2a8ba28f4c8623cf2075659406c1936449db6a9d2450","observation_id":"2d3b758c-01ec-4f00-8584-2d1dbeda2f49","resolution":{"observed_at":"2026-08-12T11:56:21.012376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.525442Z","title":null,"venue":null,"work_id":"6583ecc7-bac9-44e6-bda5-d2fe393e8601","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.017500Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:b680d8bc188d0591418ad0c8e95f70fc08661dfd185950cfe6b675e1688ff7d8","observation_id":"3ac8c7fa-0f30-479f-8f82-fc30170e4a39","resolution":{"observed_at":"2026-08-12T11:56:21.530325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14446","last_updated":"2024-05-29T13:56:29Z","snapshot_observed_at":"2026-08-13T04:34:33.163157Z","submitted_at":"2024-01-25T18:58:05Z","title":"Black-Box Access is Insufficient for Rigorous AI Audits","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14446","snapshot_observed_at":"2026-08-12T11:56:21.024293Z","title":"Black-Box Access is Insufficient for Rigorous AI Audits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.024293Z"},"links":{"cited_paper":"/paper/2401.14446","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:ec0a58eabeec95529c9d500426410068433d0a6dcb717e59bbe9dd6f51407ab3","observation_id":"12a40c67-8ce5-441d-8cc3-e7c4a83cb7fd","resolution":{"observed_at":"2026-08-12T11:56:21.024293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.509669Z","title":"Number 1","venue":null,"work_id":"4d718c48-6add-4d05-87ab-b7e32161abcd","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.029232Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:1ab2e38b9efbe94b423bb051b756223554a52ba452e6c03eac61d579ae320fb9","observation_id":"300b0777-7082-439e-ae89-b4811143885e","resolution":{"observed_at":"2026-08-12T11:56:21.514424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.494262Z","title":"Mistral CEO confirms ‘leak’ of new open source AI model nearing GPT-4 performance","venue":null,"work_id":"084ca7e2-a0e4-459a-89b4-98921577e317","year":null},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.035546Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:b7ccd5bca1a6b59279075008f8eda33d56db5df247f883b90c61562077c10cd8","observation_id":"26f9a1da-deb7-4799-9710-10215a022e79","resolution":{"observed_at":"2026-08-12T11:56:21.499309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00374","last_updated":"2023-09-30T13:38:33Z","snapshot_observed_at":"2026-08-13T10:00:54.663134Z","submitted_at":"2023-09-30T13:38:33Z","title":"Coordinated pausing: An evaluation-based coordination scheme for frontier AI developers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00374","snapshot_observed_at":"2026-08-12T11:56:21.045148Z","title":"Coordinated pausing: An evaluation-based coordination scheme for frontier ai developers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.045148Z"},"links":{"cited_paper":"/paper/2310.00374","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:c42918480dac8952dd2438d085012b77d59a4f8159ff58c280ddd00df251d9bb","observation_id":"b269c1b4-c725-4567-b27c-298ddd69fc68","resolution":{"observed_at":"2026-08-12T11:56:21.045148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-13T17:57:00.514926Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-12T11:56:21.049719Z","title":"Cyberseceval 2: A wide-ranging cybersecurity evaluation suite for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.049719Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:7098b6228afa0788a94ac1dfb1701572af84729d09a224dc541dfb70923987db","observation_id":"32c574b4-ab9c-4204-806c-30cee30ae79d","resolution":{"observed_at":"2026-08-12T11:56:21.049719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.461997Z","title":"Project Naptime: Evaluating Offensive Security Capabili- ties of Large Language Models","venue":null,"work_id":"fdc25135-84a6-4a6f-961a-8d280aa8e97a","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.054573Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:8720d7dfd81b726e3f6a5f5c6f906f7b1b4b09f08d70510f223fd286f8e3630a","observation_id":"9b452253-cdb7-4371-bea3-85ac17dd387d","resolution":{"observed_at":"2026-08-12T11:56:21.467303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07413","last_updated":"2023-12-12T16:34:19Z","snapshot_observed_at":"2026-08-13T05:04:02.544193Z","submitted_at":"2023-12-12T16:34:19Z","title":"AI capabilities can be significantly improved without expensive retraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07413","snapshot_observed_at":"2026-08-12T11:56:21.059369Z","title":"AI capabilities can be significantly improved without expensive retraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.059369Z"},"links":{"cited_paper":"/paper/2312.07413","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:8c6eb5b900e6fd17304062ce54675b5202d26ee7ad14a3680ae0ac9f77c0ac63","observation_id":"2cdbc31e-6fd0-40f6-9683-586b08b5b7df","resolution":{"observed_at":"2026-08-12T11:56:21.059369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.064339Z","title":"SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.064339Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:dde56a2f97b3403ee7a4b0e1cb55329d4cc4368a8772044fb9561df8cb4cde87","observation_id":"0b1e790e-94f8-468b-85ec-2729c0a77599","resolution":{"observed_at":"2026-08-12T11:56:21.064339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.435625Z","title":"SWE-bench leaderboard","venue":null,"work_id":"2115dd0b-e7fc-411a-a8f5-683e57d7d9bf","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.069025Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:aafeeee0f823d7d8711c3923acd3d92f1156a502a85a22ff3ccecbc671d1325e","observation_id":"0be6524a-f8b9-4584-9f82-8045a94b9f74","resolution":{"observed_at":"2026-08-12T11:56:21.440729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.419629Z","title":"GAIA Leaderboard - a Hugging Face Space by gaia-benchmark","venue":null,"work_id":"5043565d-bde3-4779-9d41-77242cb1c21b","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.073748Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:d813c77d5f7b36cf11709221f8193c7225f7bf0e557f46ce45a7ef493ef1f619","observation_id":"6b0b18a3-90b8-43a3-bb7f-733cfd2ffecf","resolution":{"observed_at":"2026-08-12T11:56:21.424786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.403492Z","title":"HumanEval Benchmark (Code Generation)","venue":null,"work_id":"2b411d46-0cbd-4cdb-9ab3-3df0beb742a9","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.078515Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:3226ab714ba8c0c84e37216a2a33277db833ec76b1ad21da2522d0715395246f","observation_id":"4975690c-760e-4c98-ae24-983f7d988b7e","resolution":{"observed_at":"2026-08-12T11:56:21.408538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.083324Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.083324Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:8b055c1709120a95deac55b11de46ea8ec6e36d3ab7d9904fbb96dbc7c50cd34","observation_id":"39d36d8a-4b55-4336-922f-1c3e625b3269","resolution":{"observed_at":"2026-08-12T11:56:21.083324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.376607Z","title":"Anthropic’s Responsible Scaling Policy, 2024","venue":null,"work_id":"d6e40b82-ae24-43a3-bcaa-e9c51dcf44e9","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.087823Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:b3259ace6add8d6262fb3b69ef0cda29efb0792bfb37d6b753c5a639b2508b32","observation_id":"f7345fa4-c59e-4de9-8973-045ab5437f15","resolution":{"observed_at":"2026-08-12T11:56:21.382641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.359013Z","title":"We need a Science of Evals","venue":null,"work_id":"65104659-30a4-47a8-a356-31157a5c57d2","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.092632Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:59ef1b575e3ae8f88d14e4928550533a4afe41bef7f8dc54b812e6aaa487c931","observation_id":"f59e5af6-936f-44b7-9435-3081475a4b5f","resolution":{"observed_at":"2026-08-12T11:56:21.365857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07358","last_updated":"2025-02-06T20:58:43Z","snapshot_observed_at":"2026-08-12T23:45:27.538295Z","submitted_at":"2024-06-11T15:26:57Z","title":"AI Sandbagging: Language Models can Strategically Underperform on Evaluations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07358","snapshot_observed_at":"2026-08-12T11:56:21.097843Z","title":"Brown, and Francis Rhys Ward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.097843Z"},"links":{"cited_paper":"/paper/2406.07358","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:06ef328bca45ef96aec4c46a39b9f7f16aaf847468560186d231269bd852a730","observation_id":"7c19e7bd-3cd7-4c9b-bfa1-4a682fc8b45e","resolution":{"observed_at":"2026-08-12T11:56:21.097843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19550","last_updated":"2024-05-29T22:26:26Z","snapshot_observed_at":"2026-08-12T23:54:44.015560Z","submitted_at":"2024-05-29T22:26:26Z","title":"Stress-Testing Capability Elicitation With Password-Locked Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19550","snapshot_observed_at":"2026-08-12T11:56:21.102873Z","title":"Stress-testing capability elicitation with password-locked models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.102873Z"},"links":{"cited_paper":"/paper/2405.19550","citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:c45c3e9113b86437e632622e8bf60ec5884432625ecc6572118b2d8f3aff6903","observation_id":"7d36241c-6419-43a1-a959-e4f407471c27","resolution":{"observed_at":"2026-08-12T11:56:21.102873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:56:21.478410Z","title":null,"venue":null,"work_id":"a19f8736-5d9e-4b51-bb17-859fd34aba0c","year":2024},"citing_paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:21.040583Z"},"links":{"citing_paper":"/paper/2412.08653"},"observation_digest":"sha256:352a4559f35ae4b24cf4df289d419f151618889ee43416eb207af7225ef8131b","observation_id":"8c2a2164-8318-49f5-bb5a-3d9fa2172135","resolution":{"observed_at":"2026-08-12T11:56:21.483430Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08653","last_updated":"2024-11-26T18:00:36Z","latest_version":1,"primary_category":"cs.CY","snapshot_observed_at":"2026-08-13T05:20:25.142094Z","submitted_at":"2024-11-26T18:00:36Z","title":"What AI evaluations for preventing catastrophic risks can and cannot do"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":17,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2412.08653."}