{"as_of":"2026-08-10T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9074fcd0add0c8b0510ad6acfd57100dd816b094610161148e36eb8f7ecb74a0","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:38.745141Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:40:54.002702Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:15:44.642321Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"cited_work":{"arxiv_id":"2507.12872","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12872","snapshot_observed_at":"2026-07-01T10:15:44.642321Z","title":"arXiv preprint arXiv:2507.12872 , year=","venue":null,"work_id":"776d4b20-4762-436b-b86e-523ce82019f0","year":null},"citing_paper":{"arxiv_id":"2606.31916","last_updated":"2026-06-30T16:22:12Z","snapshot_observed_at":"2026-08-02T10:24:05.379334Z","submitted_at":"2026-06-30T16:22:12Z","title":"Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-01T05:40:54.002702Z"},"links":{"cited_paper":"/paper/2507.12872","citing_paper":"/paper/2606.31916"},"observation_digest":"sha256:be81e28066a387e26b709052b483c18d7e3a03fb8952e20859d2ba367d14f0ae","observation_id":"5afbc83d-aa33-4eae-bf22-40991007b544","resolution":{"observed_at":"2026-07-01T10:15:44.643863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12872/citation-record","integrity":"/paper/2507.12872/integrity","json":"/paper/2507.12872/citation-record.json","paper":"/paper/2507.12872"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.03336","last_updated":"2024-11-07T09:18:26Z","snapshot_observed_at":"2026-07-06T19:45:44.484683Z","submitted_at":"2024-10-29T17:55:29Z","title":"Towards evaluations-based safety cases for AI scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03336","snapshot_observed_at":"2026-08-06T16:39:33.388263Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:33.388263Z"},"links":{"cited_paper":"/paper/2411.03336","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:1711e168733e0f1c3171ddaa1b4bf3d343ba63670222e98cfdc6069546f0f017","observation_id":"3c8a5245-5b7a-4bec-a5f1-ef815bdc27a2","resolution":{"observed_at":"2026-08-06T16:39:33.388263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21514","last_updated":"2024-10-28T20:34:51Z","snapshot_observed_at":"2026-07-06T19:41:10.332290Z","submitted_at":"2024-10-28T20:34:51Z","title":"Sabotage Evaluations for Frontier Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21514","snapshot_observed_at":"2026-08-06T16:39:33.510287Z","title":"arXiv:2410.21514","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:33.510287Z"},"links":{"cited_paper":"/paper/2410.21514","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:25ace04b73fcd8a9fd78df1587049b0d269655d55b57c156920cdc64c89ae553","observation_id":"3dd1535e-65ea-4ea5-b03b-12a6419c341d","resolution":{"observed_at":"2026-08-06T16:39:33.510287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18565","last_updated":"2025-05-05T20:52:36Z","snapshot_observed_at":"2026-08-07T16:00:36.504782Z","submitted_at":"2025-04-21T11:39:22Z","title":"RepliBench: Evaluating the Autonomous Replication Capabilities of Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18565","snapshot_observed_at":"2026-08-06T16:39:33.918076Z","title":"arXiv:2504.18565","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:33.918076Z"},"links":{"cited_paper":"/paper/2504.18565","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:182f289bcf0ca71ecb5f83cb3c954b0ac6e044b4cd9241718a0ea932c596a86d","observation_id":"5daba2b2-56c1-428a-9a14-c27588fa87d8","resolution":{"observed_at":"2026-08-06T16:39:33.918076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21572","last_updated":"2024-10-28T22:08:28Z","snapshot_observed_at":"2026-07-06T19:41:10.332290Z","submitted_at":"2024-10-28T22:08:28Z","title":"Safety cases for frontier AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21572","snapshot_observed_at":"2026-08-06T16:39:34.221645Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:34.221645Z"},"links":{"cited_paper":"/paper/2410.21572","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:42da2d34080961862461f5fd0cbdb9011a35a3b5932e098368c47754b66b058c","observation_id":"a4c7f23e-f1b2-4122-a1ef-f42783b790ab","resolution":{"observed_at":"2026-08-06T16:39:34.221645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-10T11:37:23.229129Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03827","snapshot_observed_at":"2026-08-06T16:39:34.368752Z","title":"arXiv:2212.03827","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:34.368752Z"},"links":{"cited_paper":"/paper/2212.03827","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:34345e1b59787ff357c042e6a55b23f2a93d84f028396d6de9c5a7275c55c0fa","observation_id":"4fd43903-ab84-4a90-8136-6b47cfd3699f","resolution":{"observed_at":"2026-08-06T16:39:34.368752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.536021Z","title":"doi: 10.1126/science","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:34.536021Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:c85a8db0ea5038e8c9f17c193ee45777893e9a555deac5f96eadee26bb12803c","observation_id":"eb126926-4866-4039-ba8a-20e9b42e8c9c","resolution":{"observed_at":"2026-08-06T16:39:34.536021Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08088","last_updated":"2024-11-12T18:45:08Z","snapshot_observed_at":"2026-08-10T04:37:54.272386Z","submitted_at":"2024-11-12T18:45:08Z","title":"Safety case template for frontier AI: A cyber inability argument","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08088","snapshot_observed_at":"2026-08-06T16:39:34.797703Z","title":"Google DeepMind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:34.797703Z"},"links":{"cited_paper":"/paper/2411.08088","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:40c29d84ddda25698c73b553865ee78346ea39c04893dc4227ff297f85201af6","observation_id":"2f5945e5-cfdb-47ac-96b1-87d871d8d1b3","resolution":{"observed_at":"2026-08-06T16:39:34.797703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T16:39:34.936205Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:34.936205Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:aca59b4413ccfa80298dcdace6e827c2996b5f1c3652aa8b98987e9e9490b913","observation_id":"092ed59a-3920-4f54-a142-9417237a6709","resolution":{"observed_at":"2026-08-06T16:39:34.936205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00586","last_updated":"2024-11-30T21:02:06Z","snapshot_observed_at":"2026-07-06T19:59:33.383151Z","submitted_at":"2024-11-30T21:02:06Z","title":"Evaluating Large Language Models' Capability to Launch Fully Automated Spear Phishing Campaigns: Validated on Human Subjects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00586","snapshot_observed_at":"2026-08-06T16:39:35.146041Z","title":"Dan Hendrycks, Mantas Mazeika, and Thomas Woodside","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:35.146041Z"},"links":{"cited_paper":"/paper/2412.00586","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:25e4a164eb5516ffde906336315b8e1f18308aac97de4b2678d2ce64cd16886f","observation_id":"d8251340-9940-4529-9b26-d5f2fa42defb","resolution":{"observed_at":"2026-08-06T16:39:35.146041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12001","last_updated":"2023-10-09T22:57:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-21T03:35:06Z","title":"An Overview of Catastrophic AI Risks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12001","snapshot_observed_at":"2026-08-06T16:39:35.301994Z","title":"Evan Hubinger, Chris van Merwijk, Vladimir Mikulik, Joar Skalse, and Scott Garrabrant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:35.301994Z"},"links":{"cited_paper":"/paper/2306.12001","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:b78d327f5b0b770f521f7f2513b74d3a2d6ca22ba18f7013824d9e2c53d076de","observation_id":"f4514e2c-d7c9-4557-878f-44d85e69c1a3","resolution":{"observed_at":"2026-08-06T16:39:35.301994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06700","last_updated":"2024-12-09T17:46:28Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:46:28Z","title":"Facade: High-Precision Insider Threat Detection Using Deep Contextual Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2412.06700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06700","snapshot_observed_at":"2026-08-06T16:39:39.445873Z","title":"Facade: High-Precision Insider Threat Detection Using Deep Contextual Anomaly Detection","venue":"cs.CR","work_id":"ddb3c8db-92a2-4e43-b42c-e97ee4d170e0","year":2024},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:35.608070Z"},"links":{"cited_paper":"/paper/2412.06700","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:6f252aa8150c7ed30e736216bbb53a6e43a7260df6e7a8560539e57c1ac0f833","observation_id":"40ebb534-918c-4ad6-a927-557843c99c51","resolution":{"observed_at":"2026-08-06T16:39:39.585842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17315","last_updated":"2025-01-28T21:52:15Z","snapshot_observed_at":"2026-08-10T04:42:04.066190Z","submitted_at":"2025-01-28T21:52:15Z","title":"A sketch of an AI control safety case","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17315","snapshot_observed_at":"2026-08-06T16:39:35.743325Z","title":"arXiv:2501.17315","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:35.743325Z"},"links":{"cited_paper":"/paper/2501.17315","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:84c168edfb3c64400a4297ef88747b2ec34e7b7988a2f096c425e6f0c6e93276","observation_id":"35a9ba68-1cf3-48a7-a135-5e6f71fe3865","resolution":{"observed_at":"2026-08-06T16:39:35.743325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14499","last_updated":"2026-07-10T21:48:09Z","snapshot_observed_at":"2026-08-07T16:54:09.525403Z","submitted_at":"2025-03-18T17:59:31Z","title":"Measuring AI Ability to Complete Long Software Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14499","snapshot_observed_at":"2026-08-06T16:39:35.884820Z","title":"Rudolf Laine, Bilal Chughtai, Jan Betley, Kaivalya Hariharan, Mikita Balesni, Jérémy Scheurer, Marius Hobbhahn, Alexander Meinke, and Owain Evans","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:35.884820Z"},"links":{"cited_paper":"/paper/2503.14499","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:3148d6f7b07cde075f921b4d923964115e4ccb57b59209fc0747a99344992c6c","observation_id":"ca512bf0-6067-4e17-8342-e8b8d5e4dcdc","resolution":{"observed_at":"2026-08-06T16:39:35.884820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12480","last_updated":"2025-04-04T16:36:02Z","snapshot_observed_at":"2026-08-10T12:10:48.034467Z","submitted_at":"2024-12-17T02:33:45Z","title":"Subversion Strategy Eval: Can language models statelessly strategize to subvert control protocols?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12480","snapshot_observed_at":"2026-08-06T16:39:36.071018Z","title":"Yohan Mathew, Ollie Matthews, Robert McCarthy, Joan Velja, Christian Schroeder de Witt, Dylan Cope, and Nandi Schoots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.071018Z"},"links":{"cited_paper":"/paper/2412.12480","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:beda7d7e3f7240385ac670fb820b91554d8443bdf7128d9c7d9b3ae717c39199","observation_id":"82d8d8d1-f84e-4a27-b3c1-ece7c72ba992","resolution":{"observed_at":"2026-08-06T16:39:36.071018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:36.234981Z","title":"arXiv:2410.03768","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.234981Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:b7f8a4d5ebe050f8c776a9bbccee8075ca3edf58fe25451c989c70c465371f5e","observation_id":"f295ef85-315e-4427-ad9d-383551dc10ce","resolution":{"observed_at":"2026-08-06T16:39:36.234981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.01724","last_updated":"2017-03-03T21:17:05Z","snapshot_observed_at":"2026-07-06T05:25:21.010274Z","submitted_at":"2017-01-06T18:56:49Z","title":"DeepStack: Expert-Level Artificial Intelligence in No-Limit Poker","version":3},"cited_work":{"arxiv_id":"1701.01724","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.01724","snapshot_observed_at":"2026-08-06T16:39:39.203872Z","title":"DeepStack: Expert-Level Artificial Intelligence in No-Limit Poker","venue":"cs.AI","work_id":"73e489df-6346-4419-a557-21997cb935c3","year":2017},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.399493Z"},"links":{"cited_paper":"/paper/1701.01724","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:337f260772f4a4c7e724993423954c909d9ee57dcd60edd5b6ca4a78a5fdd3dd","observation_id":"ab9e34a3-8724-443e-82f5-200cdb825ffd","resolution":{"observed_at":"2026-08-06T16:39:39.324600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04018","last_updated":"2026-06-22T12:47:48Z","snapshot_observed_at":"2026-08-09T08:53:39.548570Z","submitted_at":"2025-06-04T14:46:47Z","title":"AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04018","snapshot_observed_at":"2026-08-06T16:39:36.526571Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.526571Z"},"links":{"cited_paper":"/paper/2506.04018","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:91ec60c174ea9c0cff37d813cc6e19e592b3eac34e7c2a14aba133040a4d6474","observation_id":"4a7314a0-47fe-4c6f-85f8-3eaf24427fd8","resolution":{"observed_at":"2026-08-06T16:39:36.526571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-07T13:08:50.821464Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-06T16:39:36.667793Z","title":"Sella Nevo, Dan Lahav, Ajay Karpur, Yogev Bar-On, Henry Alexander Bradley, and Jeff Alstott","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.667793Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:7a3da9e2d4f68150442f01be5b39080fad71a27b46eaeff7216d9e70fa5cfb8a","observation_id":"d196b84c-0b27-4bf2-a575-2e893d947be3","resolution":{"observed_at":"2026-08-06T16:39:36.667793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-07T11:47:24.992650Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T16:39:36.793291Z","title":"arXiv:2209.00626","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.793291Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:9b4d1c95e5e7ada15b6267c3e6d9d8f5f71c403fc7f746c3b88b424b26467731","observation_id":"7579f224-aec7-4c7a-b527-bf7b68bc9725","resolution":{"observed_at":"2026-08-06T16:39:36.793291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00967","last_updated":"2024-12-01T21:11:28Z","snapshot_observed_at":"2026-08-09T09:12:02.534839Z","submitted_at":"2024-12-01T21:11:28Z","title":"Linear Probe Penalties Reduce LLM Sycophancy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00967","snapshot_observed_at":"2026-08-06T16:39:36.959394Z","title":"org/abs/2412.00967","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.959394Z"},"links":{"cited_paper":"/paper/2412.00967","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:66b5a19cdd2d7605c990aab51cef0e7243fec795b0f6dfa43ae4e21cfa8a3a2a","observation_id":"4e3323b6-488b-486c-a837-1b926db7d428","resolution":{"observed_at":"2026-08-06T16:39:36.959394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13793","last_updated":"2024-04-05T12:26:11Z","snapshot_observed_at":"2026-08-07T13:58:15.415231Z","submitted_at":"2024-03-20T17:54:26Z","title":"Evaluating Frontier Models for Dangerous Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13793","snapshot_observed_at":"2026-08-06T16:39:37.129859Z","title":"arXiv:2403.13793","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:37.129859Z"},"links":{"cited_paper":"/paper/2403.13793","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:e5e0856df33a86f2cf52ca38cec621ef01cee1526abe3f39b152b604b9225239","observation_id":"e107757b-5e07-42fd-a604-df71d28c0cf0","resolution":{"observed_at":"2026-08-06T16:39:37.129859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14380","last_updated":"2024-03-21T13:14:40Z","snapshot_observed_at":"2026-07-06T17:48:19.344410Z","submitted_at":"2024-03-21T13:14:40Z","title":"On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14380","snapshot_observed_at":"2026-08-06T16:39:37.344120Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:37.344120Z"},"links":{"cited_paper":"/paper/2403.14380","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:07c409d6fe17869f6f007c10f8b318cd23ef7377823fcd4bf9fb2af7ed5ff105","observation_id":"6f9fe1ac-4046-4eec-97e9-b50e3d3713ca","resolution":{"observed_at":"2026-08-06T16:39:37.344120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07590","last_updated":"2024-07-15T08:51:52Z","snapshot_observed_at":"2026-08-04T14:42:36.955119Z","submitted_at":"2023-11-09T17:12:44Z","title":"Large Language Models can Strategically Deceive their Users when Put Under Pressure","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07590","snapshot_observed_at":"2026-08-06T16:39:37.499516Z","title":"arXiv:2311.07590","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:37.499516Z"},"links":{"cited_paper":"/paper/2311.07590","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:4be83d283a14feac40ea8e2e39071a8c5e7cae63f85e72b70bd0b141b2c44986","observation_id":"cbe3c3ce-fde7-47b6-9ef2-b51c5f46b7d1","resolution":{"observed_at":"2026-08-06T16:39:37.499516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.594525Z","title":"Melanie Sclar, Jane Yu, Maryam Fazel-Zarandi, Yulia Tsvetkov, Yonatan Bisk, Yejin Choi, and Asli Celikyilmaz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:37.594525Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:00332ad58640a858dac5c2d4182e3b119fc48bd413f43b39d10e3172e227ccac","observation_id":"254ec2be-34e0-49e3-abd5-1b93ff8b788c","resolution":{"observed_at":"2026-08-06T16:39:37.594525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12175","last_updated":"2024-12-12T21:29:00Z","snapshot_observed_at":"2026-07-06T20:08:02.963967Z","submitted_at":"2024-12-12T21:29:00Z","title":"Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12175","snapshot_observed_at":"2026-08-06T16:39:37.772633Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:37.772633Z"},"links":{"cited_paper":"/paper/2412.12175","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:4732e7dfab649345f66fd8ab658992464494cdbdcd417ed365c9f2469b25a82a","observation_id":"8217a998-f671-41cf-85db-56b1dbc779ac","resolution":{"observed_at":"2026-08-06T16:39:37.772633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.919794Z","title":"Cameron Tice, Philipp Alexander Kreer, Nathan Helm-Burger, Prithviraj Singh Shahani, Fedor Ryzhenkov, Jacob Haimes, Felix Hofstätter, and Teun van der Weij","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:37.919794Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:4d7b5ecc8221ccff1a6cd8c2196aa4e73b79c772790ab1a9688a8616c242cfd5","observation_id":"06a423fb-b5be-4a4d-91f9-b1f054111d87","resolution":{"observed_at":"2026-08-06T16:39:37.919794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.000260Z","title":"Oriol Vinyals, Igor Babuschkin, Wojciech M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:38.000260Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:1f4eafc14dc6c8b943dc19d1627966b99c2fe5aa1de829e0de453d99da2a86eb","observation_id":"f6142e7d-acb8-4907-bdbb-ae1fba6c8cdd","resolution":{"observed_at":"2026-08-06T16:39:38.000260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02306","last_updated":"2025-02-22T13:06:15Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:31:02Z","title":"On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02306","snapshot_observed_at":"2026-08-06T16:39:38.443628Z","title":"Shunyu Yao, Howard Chen, John Yang, and Karthik Narasimhan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:38.443628Z"},"links":{"cited_paper":"/paper/2411.02306","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:6b71ac6f51c57ac92e053b70533c12caad69e7f51696c8e5c815012ebd760ebf","observation_id":"0c2aa3db-74cd-4152-8fa1-dfcef47d83d0","resolution":{"observed_at":"2026-08-06T16:39:38.443628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01206","last_updated":"2023-02-08T01:39:30Z","snapshot_observed_at":"2026-07-06T13:27:22.300465Z","submitted_at":"2022-07-04T05:30:22Z","title":"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01206","snapshot_observed_at":"2026-08-06T16:39:38.613609Z","title":"arXiv:2207.01206","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:38.613609Z"},"links":{"cited_paper":"/paper/2207.01206","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:658201cd5294cf89bef39fa3dae386dea8452023929f186b8d1317dad040e25b","observation_id":"88aa5c2d-366c-477e-8608-eb2a8a0693c1","resolution":{"observed_at":"2026-08-06T16:39:38.613609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.805421Z","title":"trusted inquiry","venue":null,"work_id":"fc6d9deb-9d01-4d49-953d-6d930ff7bbd8","year":2000},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:38.745141Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:1b38aff03c8a8327399c421ec1405a9230102591a8f4f5db8092fed1ad3230b2","observation_id":"d92ccab7-940a-463d-a334-18a3d93c4c69","resolution":{"observed_at":"2026-08-06T16:39:39.865103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.217624Z","title":"doi: 10.1017/S0140525X00076512","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:37.217624Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:dc453f2209521c2e3cc7921dafe9ec05c336f12b7064e3a6222435db24194ab2","observation_id":"a6467fe5-0cce-4521-b018-c2720d3a5487","resolution":{"observed_at":"2026-08-06T16:39:37.217624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.187897Z","title":"doi: 10.1038/s41586-019-1724-z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:38.187897Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:e57d908d7d94cdd9939ec7f90a575dd5b0e476b46e6b240766fe1c144b6038f0","observation_id":"54ff7abf-df0b-4ce8-84da-b5785de4165c","resolution":{"observed_at":"2026-08-06T16:39:38.187897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-08-01T23:32:03.638122Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01820","snapshot_observed_at":"2026-08-06T16:39:35.476815Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:35.476815Z"},"links":{"cited_paper":"/paper/1906.01820","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:b97a3f02e162638ff0bc82bdf6cec506c3016d74e2f4b8d84dcc6d2f66b2b90b","observation_id":"45ba4898-9e81-40d1-8001-4cef1191468b","resolution":{"observed_at":"2026-08-06T16:39:35.476815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-06T16:39:38.354084Z","title":"hawthorne effect","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:38.354084Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:2b4f0f7e5fe9ae831b04b88f0fb5388aac045837ef44f03f907d57829b684886","observation_id":"9dbc06b4-a131-4486-9e6b-75de0ea0bbee","resolution":{"observed_at":"2026-08-06T16:39:38.354084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00667","last_updated":"2023-09-01T17:27:37Z","snapshot_observed_at":"2026-08-06T23:40:57.486399Z","submitted_at":"2023-09-01T17:27:37Z","title":"Taken out of context: On measuring situational awareness in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00667","snapshot_observed_at":"2026-08-06T16:39:33.641786Z","title":"arXiv:2309.00667","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:33.641786Z"},"links":{"cited_paper":"/paper/2309.00667","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:dc65df28c008604fe5006e4eca2fb9e3cc9fb3d4b19d91024263883d0df8b781","observation_id":"f5b9cf08-8480-49e9-9190-96519907496a","resolution":{"observed_at":"2026-08-06T16:39:33.641786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.962667Z","title":"Anthropic","venue":null,"work_id":"29c080e3-73e6-4aae-b99d-d50cace8985f","year":2024},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:33.247242Z"},"links":{"citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:a5d9f68a4aa83469a3f6371e3b23e9a8d4726b1ffae7892de530b75097c7976c","observation_id":"ed0ebd9f-1d21-47c4-b787-933009b79d1d","resolution":{"observed_at":"2026-08-06T16:39:40.048618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10374","last_updated":"2025-04-14T16:22:11Z","snapshot_observed_at":"2026-08-07T16:05:49.364751Z","submitted_at":"2025-04-14T16:22:11Z","title":"Ctrl-Z: Controlling AI Agents via Resampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10374","snapshot_observed_at":"2026-08-06T16:39:33.772218Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:33.772218Z"},"links":{"cited_paper":"/paper/2504.10374","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:cd0ad6fde7b724a33fe63ec6a4e798f6d18dd8637f0c0a4cd3c8c12597ddf8c2","observation_id":"86c9ba4b-f572-46cf-8cae-43602dff42c7","resolution":{"observed_at":"2026-08-06T16:39:33.772218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2507.12872."}