{"as_of":"2026-08-10T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d327641e557a4cb9ea4e0c84afec919ca92246e2ee8fd719a6672d243c71752","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:10.795238Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:14:22.854339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18807","snapshot_observed_at":"2026-08-06T15:14:22.854339Z","title":"Mitigating deceptive alignment via self-monitoring.arXiv preprint arXiv:2505.18807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16534","last_updated":"2025-07-26T12:33:42Z","snapshot_observed_at":"2026-08-10T02:11:35.629269Z","submitted_at":"2025-07-22T12:44:38Z","title":"Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:22.854339Z"},"links":{"cited_paper":"/paper/2505.18807","citing_paper":"/paper/2507.16534"},"observation_digest":"sha256:e1e3170e7c19e8245a97cf099ee02c7d8fa97a4560cf32bab47546f62fbe3926","observation_id":"50541677-0d41-417a-94bd-ff30d9a909d5","resolution":{"observed_at":"2026-08-06T15:14:22.854339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"cited_work":{"arxiv_id":"2505.18807","doi":"10.48550/arxiv.2505.18807","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18807","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mit- igating deceptive alignment via self-monitoring.arXiv preprint arXiv:2505.18807,","venue":"ArXiv.org","work_id":"2837b9c9-d233-478b-be99-a96ee1ce7743","year":2025},"citing_paper":{"arxiv_id":"2605.30169","last_updated":"2026-07-02T23:58:01Z","snapshot_observed_at":"2026-08-01T18:48:30.510137Z","submitted_at":"2026-05-28T16:20:19Z","title":"Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T00:26:54.019256Z"},"links":{"cited_paper":"/paper/2505.18807","citing_paper":"/paper/2605.30169"},"observation_digest":"sha256:7565ae761e31adf35c2fc00f349ccc5ec39495bc9a2ad0269e6ae2c370b32deb","observation_id":"a6261264-1330-46ef-b544-535ee79766d2","resolution":{"observed_at":"2026-06-29T00:32:53.204147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"cited_work":{"arxiv_id":"2505.18807","doi":"10.48550/arxiv.2505.18807","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18807","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mit- igating deceptive alignment via self-monitoring.arXiv preprint arXiv:2505.18807,","venue":"ArXiv.org","work_id":"2837b9c9-d233-478b-be99-a96ee1ce7743","year":2025},"citing_paper":{"arxiv_id":"2606.25899","last_updated":"2026-06-24T14:47:47Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:47:47Z","title":"Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T19:07:05.406391Z"},"links":{"cited_paper":"/paper/2505.18807","citing_paper":"/paper/2606.25899"},"observation_digest":"sha256:85597f994155ef8645ee6b7528fa975a85ab17d0e5746b6fb674beeb13388ac8","observation_id":"1a36a228-ee59-44e3-8cfa-6360fc35e8dc","resolution":{"observed_at":"2026-07-04T21:00:10.043768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18807/citation-record","integrity":"/paper/2505.18807/integrity","json":"/paper/2505.18807/citation-record.json","paper":"/paper/2505.18807"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.639986Z","title":"Introducing openai o1-preview","venue":null,"work_id":"860dccf5-321c-494e-953e-ed59deae2bfe","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:03.992286Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:2033001e3b532843b9a733c8988da25265346d59dc186235f67a8ecab5f9e57e","observation_id":"83677165-82a4-4664-bd97-21887015e19b","resolution":{"observed_at":"2026-08-07T14:30:18.690887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:30:04.060422Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.060422Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:fb0a1dd9a853bf77a35a7a15d416ce756fff159a8b1f00f79bb66139b3d532de","observation_id":"bc6cad5f-5a5d-4302-82d2-65ce6a296a0b","resolution":{"observed_at":"2026-08-07T14:30:04.060422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:04.114784Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.114784Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:9a0d76513a59a0492e419a294be4ff500cef634ab2e530cd2a90762eabe4f336","observation_id":"51cf49de-8586-462c-bddf-9c41241e9cc2","resolution":{"observed_at":"2026-08-07T14:30:04.114784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-07T14:30:04.196418Z","title":"Ai alignment: A comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.196418Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b546ef0496d9b32f6f5772ff8e6324e7d1f603817b24708e48b0cd9f8acff3ec","observation_id":"09c55401-661d-49d0-848f-bfa1201258ca","resolution":{"observed_at":"2026-08-07T14:30:04.196418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-08-01T23:32:03.638122Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01820","snapshot_observed_at":"2026-08-07T14:30:04.260470Z","title":"Risks from learned optimization in advanced machine learning systems","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.260470Z"},"links":{"cited_paper":"/paper/1906.01820","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:fb1fd45dc57cf25fea800ad1220630703f6c6f295978ecd83871ef46bc672a18","observation_id":"dc773ee9-4491-4355-afb5-143fe9e19624","resolution":{"observed_at":"2026-08-07T14:30:04.260470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-08-09T13:05:34.738390Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-07T14:30:04.319823Z","title":"Frontier models are capable of in-context scheming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.319823Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f657f3fa63f88130177b50e0242202ae2bb3c560b5146fa485787b6fb76374b6","observation_id":"80a65e4f-f2a7-4382-b739-6637b0c24c72","resolution":{"observed_at":"2026-08-07T14:30:04.319823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T14:30:04.428012Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.428012Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:d4f3691d0381df78409bcf195e8a7f3503a7c8d7f96bf3c4e9ebd70a9be00955","observation_id":"0c2bc9d3-9b3a-4bd8-a2df-7f37c0a94918","resolution":{"observed_at":"2026-08-07T14:30:04.428012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12822","last_updated":"2024-12-08T04:06:53Z","snapshot_observed_at":"2026-07-06T19:18:12.969683Z","submitted_at":"2024-09-19T14:50:34Z","title":"Language Models Learn to Mislead Humans via RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12822","snapshot_observed_at":"2026-08-07T14:30:04.463941Z","title":"Language models learn to mislead humans via rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.463941Z"},"links":{"cited_paper":"/paper/2409.12822","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:446b933e00c81b375960afe4aa2271133446a2bbc7db96475304e564498b5b27","observation_id":"904a83a5-b850-4e07-b3f5-645ad7b05482","resolution":{"observed_at":"2026-08-07T14:30:04.463941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:04.536207Z","title":"Managing extreme ai risks amid rapid progress","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.536207Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:4e4df20b400f027b2bd8b196e138d10d0867bc07c24214b5a74c1cf6982d298b","observation_id":"3bda92d4-c08e-4a48-90b0-53f4e7113efb","resolution":{"observed_at":"2026-08-07T14:30:04.536207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.446032Z","title":"Privacy risks of general-purpose language models","venue":null,"work_id":"1bffb7e6-a950-47ff-b294-8854cd9e51cf","year":2020},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.735429Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f49056bc75fae1a36fbf2ba323da86513e9913dac6feb173985b4da8d401b26d","observation_id":"d1c7d851-abb7-46c1-ad89-0635acd982e8","resolution":{"observed_at":"2026-08-07T14:30:18.514680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12140","last_updated":"2024-12-09T15:01:37Z","snapshot_observed_at":"2026-08-06T10:04:05.646150Z","submitted_at":"2024-12-09T15:01:37Z","title":"Frontier AI systems have surpassed the self-replicating red line","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12140","snapshot_observed_at":"2026-08-07T14:30:04.787401Z","title":"Frontier ai systems have surpassed the self-replicating red line","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.787401Z"},"links":{"cited_paper":"/paper/2412.12140","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5283fe4fcdedda4ab67f4f7b4b9f998ef78e8468186577dd84fe7ab2130b0823","observation_id":"098f5cbd-18e0-4689-9dbb-e7359454e794","resolution":{"observed_at":"2026-08-07T14:30:04.787401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T14:30:04.868190Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.868190Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:4a4e9a5a6175c73bc1849d0864ce508334887ffdf0530e388dfeb5ec794f2296","observation_id":"f0b4bd89-2800-4f79-8679-5371b3c50fe4","resolution":{"observed_at":"2026-08-07T14:30:04.868190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:30:04.987930Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.987930Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:90b3c090b896e6628aa352e94ef9dc0a5130747ca95f527d133083e5cc05f767","observation_id":"2fa7d15b-f588-41bb-b358-f85bac93806f","resolution":{"observed_at":"2026-08-07T14:30:04.987930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.098703Z","title":"Darkbench: Benchmarking dark patterns in large language models","venue":null,"work_id":"7580e43c-4092-42d8-8652-7e2ad929d6ff","year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.047058Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:09c3cc800191a0db340fdf7968c0abb4c95413341e0083c7e40846cac4a543c6","observation_id":"26c081fb-2fb4-4bc7-a133-8512d908309b","resolution":{"observed_at":"2026-08-07T14:30:18.182736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12206","last_updated":"2025-02-16T16:29:20Z","snapshot_observed_at":"2026-08-07T18:14:33.078941Z","submitted_at":"2025-02-16T16:29:20Z","title":"Evaluating the Paperclip Maximizer: Are RL-Based Language Models More Likely to Pursue Instrumental Goals?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12206","snapshot_observed_at":"2026-08-07T14:30:05.120166Z","title":"Evaluating the paperclip maximizer: Are rl-based language models more likely to pursue instrumental goals? arXiv preprint arXiv:2502.12206, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.120166Z"},"links":{"cited_paper":"/paper/2502.12206","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:62a1de825dbcbcecba9816d043b53cd0be285b73bc71fba8d6708663affe9210","observation_id":"40edb399-1f95-4346-86e6-090ebf81128c","resolution":{"observed_at":"2026-08-07T14:30:05.120166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-07T14:30:05.188094Z","title":"Sleeper agents: Training deceptive llms that persist through safety training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.188094Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:dfb2569510a42b253a77580f166f9c93fa4a8b1134fa4e6ecd12da6226247eee","observation_id":"673ccd70-0688-48b4-b0f3-f48a23bd1dec","resolution":{"observed_at":"2026-08-07T14:30:05.188094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17805","last_updated":"2025-01-29T17:47:36Z","snapshot_observed_at":"2026-08-10T04:29:34.143989Z","submitted_at":"2025-01-29T17:47:36Z","title":"International AI Safety Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17805","snapshot_observed_at":"2026-08-07T14:30:05.234059Z","title":"International ai safety report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.234059Z"},"links":{"cited_paper":"/paper/2501.17805","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:8b004e953de429f39f457fea2793d97be4873f7456388e2316d516bb7369433e","observation_id":"8d4e3e7a-8f66-4be0-b3fd-1477604c2cd2","resolution":{"observed_at":"2026-08-07T14:30:05.234059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.260854Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.260854Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:4e60eda8007260235397cdc378d53e6d4deb04714813857167ce8787a7d077bf","observation_id":"8ee0c132-066c-4f33-832b-40e96438b21d","resolution":{"observed_at":"2026-08-07T14:30:05.260854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14521","last_updated":"2025-03-14T19:54:18Z","snapshot_observed_at":"2026-08-07T17:02:53.293444Z","submitted_at":"2025-03-14T19:54:18Z","title":"Policy Frameworks for Transparent Chain-of-Thought Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14521","snapshot_observed_at":"2026-08-07T14:30:05.298607Z","title":"Policy frameworks for trans- parent chain-of-thought reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.298607Z"},"links":{"cited_paper":"/paper/2503.14521","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:eda39ad444b38f5e35440f0c2ef433e2cc493a61c7d43800b54296001ce77f65","observation_id":"d9afa334-7493-405b-b63e-a82a78f5d73c","resolution":{"observed_at":"2026-08-07T14:30:05.298607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-07T14:30:05.384371Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.384371Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b28fdd63359fe80df16ed25a7364d207bea4ee98e8f5b2764eb556a2845bb34e","observation_id":"b0e2b95f-069b-4d5f-b70c-6d85580017cf","resolution":{"observed_at":"2026-08-07T14:30:05.384371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T14:30:05.477915Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.477915Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:03f6e987a114bd290f52224702e20c36dfaabf1ede1316fa50e6ccac29bd052c","observation_id":"bea15da7-e936-4cbd-84b6-7fe78ea1b9a9","resolution":{"observed_at":"2026-08-07T14:30:05.477915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.595053Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.595053Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f51d1535e91076c217c982ffc8f58d4dd24aaaec41f54835b6a9e6bbfa19c914","observation_id":"e12a21ad-c180-41f2-a85f-4a0d1874be96","resolution":{"observed_at":"2026-08-07T14:30:05.595053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.716513Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.716513Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:d894fe44841a7c221c15fbbcf34fc4170573dbbfb9444bd8988b92417b2aad42","observation_id":"8694ca25-0e87-4150-a6e4-bd758a5fc61b","resolution":{"observed_at":"2026-08-07T14:30:05.716513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.874104Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.874104Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:3287c653ed0c1c98e705439998a8832d9b3f70834c52c96e1db680fb70b2eba0","observation_id":"02639ee0-cd8c-40c4-8bb0-31684ae7ceef","resolution":{"observed_at":"2026-08-07T14:30:05.874104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.978324Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.978324Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:07ce14740616125890b7232d4ffbddf86588d793511250b050934a4b3a4dad53","observation_id":"7e9cdb46-9f25-447e-ad2f-6c6f25721ab5","resolution":{"observed_at":"2026-08-07T14:30:05.978324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.810038Z","title":"Handbook of constraint programming","venue":null,"work_id":"d0be104c-bbc8-48a0-a38c-aa90357e4de3","year":2006},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.196688Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:1afae22991d65790420229c3147596de427a4cfc43afaf9a5e3654e0e15ab876","observation_id":"1cb8ea0a-c44f-461f-a6cc-02ebeb23f7bc","resolution":{"observed_at":"2026-08-07T14:30:17.898223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:06.349381Z","title":"Defining and characterizing reward gaming","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.349381Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:0617dfd81acfc53d7f40557836f1febf31b36d6cdbf5b73e5c6b3d7803a4888a","observation_id":"c4c02e54-93f3-4779-a680-44c8d90d28b3","resolution":{"observed_at":"2026-08-07T14:30:06.349381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:06.469580Z","title":"Cooperative inverse reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.469580Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:8f6d648637d79bdf7fda60aeedf9d7c7d31d71c85f0b0ad8a18aef5e2c7b42eb","observation_id":"bbc388a2-87a0-4fde-9edf-57ab6eb42b11","resolution":{"observed_at":"2026-08-07T14:30:06.469580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05358","last_updated":"2025-03-22T02:05:56Z","snapshot_observed_at":"2026-07-06T19:12:19.677411Z","submitted_at":"2024-09-09T06:39:56Z","title":"BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05358","snapshot_observed_at":"2026-08-07T14:30:06.590347Z","title":"Bamdp shaping: a unified theoretical framework for intrinsic motivation and reward shaping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.590347Z"},"links":{"cited_paper":"/paper/2409.05358","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b89ef43184400da225b3652bffe585ea693a5632daa6440f713fd645bf00b48e","observation_id":"d808a0c0-e5fe-4fb5-a4aa-514fa1f54ebb","resolution":{"observed_at":"2026-08-07T14:30:06.590347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.597317Z","title":"Defin- ing deception in decision making","venue":null,"work_id":"ea1a27dc-4966-4061-8c3d-fa330e33153e","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.693263Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:dd0ed30a8c7d45fdf8d090b7bdb532834539b61e22060ce96888c8e560cdbac5","observation_id":"86531776-8121-4847-a77f-a686ddc8d381","resolution":{"observed_at":"2026-08-07T14:30:17.681852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.365030Z","title":"Machine behaviour","venue":null,"work_id":"33b884d6-7cec-4969-bf09-147ae0ea4cef","year":2019},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.789717Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:fe07bcf8975fba83ed5a72e1c15de88bdb338bd33060ab4a1de398fd1d143f88","observation_id":"ad4c6467-25ae-475c-adb0-b0f148400b61","resolution":{"observed_at":"2026-08-07T14:30:17.491130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:06.923371Z","title":"The off-switch game","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.923371Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:662823eaa69ad9f3f30dfe3514877699d69322ac24660f0b9ebc3bc407715606","observation_id":"6c98cc28-959e-44be-825c-ae5533d4ef4f","resolution":{"observed_at":"2026-08-07T14:30:06.923371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.044879Z","title":"Comparison of the predicted and observed secondary structure of t4 phage lysozyme","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.044879Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5d66daa40ad0e8b4b915b4c42155a54870e57fb52317c6f28353aec336a3a10d","observation_id":"9bf5cbbd-9f3b-430e-9c08-8eb0167ba75e","resolution":{"observed_at":"2026-08-07T14:30:07.044879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.054182Z","title":"Ai deception: A survey of examples, risks, and potential solutions","venue":null,"work_id":"dbad7b88-82bc-4c3c-b113-1d929953f506","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.150812Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f62df957104cd6bf9b284c0651baa5b8980a3478308d8a55bae7fcc13c623c90","observation_id":"8ed211ab-159a-4316-92c1-6b1f540e8132","resolution":{"observed_at":"2026-08-07T14:30:17.165031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-07T14:30:07.287960Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.287960Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:4588cb58365de4ff1768aa9c0439e88d9f32409c556372b51b85a7079a702a74","observation_id":"d31cd9fc-fdc5-4c26-9a4d-7a62511ab327","resolution":{"observed_at":"2026-08-07T14:30:07.287960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:16.852239Z","title":"Deception abilities emerged in large language models","venue":null,"work_id":"b6e68bf3-82f3-4488-8657-ef0e489987e6","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.410071Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:58b36a8730366d446fb9d817c48849783f707308a1cb52f32ac22b008615a4ea","observation_id":"685d6827-be15-4b6c-84e1-37ea8a7cc513","resolution":{"observed_at":"2026-08-07T14:30:16.932491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.532498Z","title":"Opendeception: Benchmarking and investigating ai deceptive behaviors via open-ended interaction simulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.532498Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:d6bfc18794050f63a2a5356a8f632fb4f85d12166214a3931773caa32725da44","observation_id":"8b5604c4-b415-429d-9b2f-96d25e8a2650","resolution":{"observed_at":"2026-08-07T14:30:07.532498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.579875Z","title":"The mask benchmark: Disentangling honesty from accuracy in ai systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.579875Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:2ddf4973979bbdfa215425bc819f9202caeea146f8c6971d084818ca8cac50c7","observation_id":"7c515169-f120-4524-803e-06527d6e6a72","resolution":{"observed_at":"2026-08-07T14:30:07.579875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07358","last_updated":"2025-02-06T20:58:43Z","snapshot_observed_at":"2026-08-06T05:53:39.626163Z","submitted_at":"2024-06-11T15:26:57Z","title":"AI Sandbagging: Language Models can Strategically Underperform on Evaluations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07358","snapshot_observed_at":"2026-08-07T14:30:07.610336Z","title":"Ai sandbagging: Language models can strategically underperform on evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.610336Z"},"links":{"cited_paper":"/paper/2406.07358","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:24a89bdf4e281650644a333ba53476d76da582e17f38a0fa0b3baf05fe514a71","observation_id":"7d88fc10-a4fe-4c1c-ba7e-dbd916a8a361","resolution":{"observed_at":"2026-08-07T14:30:07.610336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.652785Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.652785Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:984cb55c76a222018af804cea525edb568bce9f0980fbbf34ddb9e0008708660","observation_id":"dd02a31d-0f35-4579-9b8f-5b8b097f32bb","resolution":{"observed_at":"2026-08-07T14:30:07.652785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:16.114088Z","title":null,"venue":null,"work_id":"416c545c-ab86-4ec0-b123-06a3e95739ef","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.736203Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b4398f46557fb1cc50977536858e098a90f42cbbbc9f49439852d0b7ad671071","observation_id":"9a4bb438-6855-4973-90bc-3a8d6ef00006","resolution":{"observed_at":"2026-08-07T14:30:16.411365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:30:07.823125Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.823125Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:3f3121fa0fdf575bf5c9426c952de59ddf69e000612bf5a3f2ceb88c215a2866","observation_id":"ac63f8ae-d62e-4aaf-a772-6abce6e67dea","resolution":{"observed_at":"2026-08-07T14:30:07.823125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:30:07.921367Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.921367Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:44327c43bf2968a1ed635898e66c5784557244ee1b0a7f795ffc9eb2efea6b7d","observation_id":"2e534c1d-7c36-4336-8cc4-2b002bfe056f","resolution":{"observed_at":"2026-08-07T14:30:07.921367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.851272Z","title":"Claude 3","venue":null,"work_id":"3dd3e6ba-98bc-4fec-a76e-fa0399bde14a","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.983269Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:df9142e3ee4f74fa0db28d1db65548edd722b72c4dabfece74eb40227859247c","observation_id":"c22dd63e-af11-4ad2-b88f-6ea63dee549f","resolution":{"observed_at":"2026-08-07T14:30:15.968293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:30:08.031978Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.031978Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5c71bef7300cfc839d0bf6f568a6dd446fa622c352b319be5f83303b3534ce92","observation_id":"650038e4-2c1c-4935-9d89-d919d8f4e149","resolution":{"observed_at":"2026-08-07T14:30:08.031978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.682617Z","title":"Learning to reason with llms","venue":null,"work_id":"334d3d0d-7676-4a75-bc90-667de4677ccf","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.070454Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c8436c6633af3ddfc737ea5b51c26406967adf5c18ae3932fbf8badaa4b03bf2","observation_id":"1bb9ac23-60fb-4b1e-91d0-09e9e5697d2a","resolution":{"observed_at":"2026-08-07T14:30:15.760571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-08-07T14:30:08.125239Z","title":"A strongreject for empty jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.125239Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:a383c796a2dee637901ba4847a0ed229f3d4aa67a1fbc6a601ce9a4850c96ff9","observation_id":"26d25d22-bf8b-4db2-b18a-26c2de8171b7","resolution":{"observed_at":"2026-08-07T14:30:08.125239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T14:30:08.164673Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.164673Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:1fe36ed4255bf03a8530f76823366c3c360d3f08d6183b28bb2cf8b78dc3ae59","observation_id":"a0fed44a-7184-4cd2-8445-b67569db6ca0","resolution":{"observed_at":"2026-08-07T14:30:08.164673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.215835Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.215835Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c43f5bcec99660da8a71a5671f98b0d74b31672c66e6cc2c0ddd9b0d3da51e35","observation_id":"7e02df15-0093-4537-846e-9a9121732df3","resolution":{"observed_at":"2026-08-07T14:30:08.215835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.261749Z","title":"Towards evaluating the robustness of neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.261749Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:aa5f2c570268eb97b887e8cd3ec321ec6401e2b1025ad001c691b3ee1db8d795","observation_id":"48f8a6d5-94b4-4ccf-a350-a4e7af0ace1c","resolution":{"observed_at":"2026-08-07T14:30:08.261749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-08T03:05:18.803803Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-07T14:30:08.313927Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.313927Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:31e0874a5afdc764b47e45c1c0fecb17ed116a98965037f6d11ef97fb651503d","observation_id":"c2cab175-f615-481b-ba71-1124f375c68e","resolution":{"observed_at":"2026-08-07T14:30:08.313927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-07T14:30:08.351856Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.351856Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:df649b5abfab04c3eaed6cea960e34a78907e4b6113e63b034effb0358ca846b","observation_id":"fda382d3-d322-45a7-b5c5-00d39135fdbc","resolution":{"observed_at":"2026-08-07T14:30:08.351856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T14:30:08.405155Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.405155Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5f508d050cd6a8f62937d0dc8f24055a1c988a215a9c0a28611ad440d2935532","observation_id":"533de5ff-de66-4a20-bafc-ba2d1bba421f","resolution":{"observed_at":"2026-08-07T14:30:08.405155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.283898Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"1190b97a-087e-4d64-81e6-4cc878d09a3d","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.488491Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:13bad80baaa9008e1a0cf79a6b16796ba83e7e2ad7aa51bb02d2cbd37279e832","observation_id":"6ea2b524-9826-4f34-b090-b916f1f22b6b","resolution":{"observed_at":"2026-08-07T14:30:18.366017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-07T18:11:43.608954Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-07T14:30:08.592130Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.592130Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:419002f3740279db120bc931fd72b95d62c599e50288f50551e374287f9b822f","observation_id":"d66ec9ff-2935-4e0f-b5a2-1b45b0df9e93","resolution":{"observed_at":"2026-08-07T14:30:08.592130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.656029Z","title":"Star-1: Safer alignment of reasoning llms with 1k data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.656029Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b23ad75459509635b3ced7a91bc0e8e7092c896b177d367c17cb526c14aa88f1","observation_id":"99bc8ee5-75f0-47a8-901b-81b7d3569418","resolution":{"observed_at":"2026-08-07T14:30:08.656029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T14:30:08.770366Z","title":"Red-teaming large language models using chain of utterances for safety-alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.770366Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:dbe4f11cef58e1da8fdf31535adde2abcc1d9e89cc6b647bcafa4162c4679c15","observation_id":"46f8839c-2343-4faa-a81c-bff59ebf220b","resolution":{"observed_at":"2026-08-07T14:30:08.770366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.300834Z","title":"Ultrafeedback: Boosting language models with high-quality feedback, 2023","venue":null,"work_id":"9f276cef-1049-435c-9b0c-ccf67f44abb9","year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.879503Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:6406456a02e98765f9a2d3a0a08c423f5c57beff5c27ec6dfdded8887877220b","observation_id":"8cc94936-efae-4f41-aa47-78820d0edf70","resolution":{"observed_at":"2026-08-07T14:30:15.472718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.994148Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.994148Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:e0c179c8d30bcd58d861839beeeb96b5af91ab8dfce5a9dd5d06fff608d97c6e","observation_id":"3497f84f-f0a4-42cb-9109-81ca5c60952d","resolution":{"observed_at":"2026-08-07T14:30:08.994148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:09.107586Z","title":"Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.107586Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c059d7ab678e3fffe00410c5911ba91ca64d47f2ce5467f968fbd4fb2d2fd923","observation_id":"c3430b97-bf70-4334-aa64-08557737abde","resolution":{"observed_at":"2026-08-07T14:30:09.107586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.042835Z","title":"mesa-objective","venue":null,"work_id":"c6a7ae9c-f883-45d8-8117-4d6c35a792dc","year":2013},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.224633Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5446bed71298c58b4096c119786c38e2ec984df6cb56174eec5de82cc59ec13d","observation_id":"8e7d481e-0a70-48e3-945c-2d83ececa2f4","resolution":{"observed_at":"2026-08-07T14:30:15.114338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.932627Z","title":null,"venue":null,"work_id":"b2bf321d-fe2f-4055-b4f1-b9f4e1617dff","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.307384Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:8cf463af60d7a87f4df3324a2d8e76b9ad3381c692a9e138d88b102770818fa1","observation_id":"7500718a-9539-4b1a-a869-0c1a98a9e116","resolution":{"observed_at":"2026-08-07T14:30:15.002661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.760016Z","title":null,"venue":null,"work_id":"6e3f3fb6-c6d4-4059-b39a-636f23a05946","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.414613Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:cc6dab69b88d576cfcd0ba400fbc23b8d00b9520944cf533fff58abd3f79aa9b","observation_id":"ba78bc72-891b-45c9-b232-1101adb05da0","resolution":{"observed_at":"2026-08-07T14:30:14.833649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.603909Z","title":null,"venue":null,"work_id":"48cd75b5-86a8-43d2-9b9c-2a34252a0f4e","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.530070Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:fcb566907bcb5cba81bed49d863057d059710921c0b0447bdd12cbca557d4bec","observation_id":"f69279a8-86bb-4350-a036-2c587f32de1c","resolution":{"observed_at":"2026-08-07T14:30:14.666887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.402815Z","title":null,"venue":null,"work_id":"0bace114-757a-4b9f-ba5b-4ebda81ffd1e","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.647676Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:74a5d97a4033c0fce70a658a64c3aa5c8c00a09f8eea3df1b4c3530374081b4c","observation_id":"f4bc6367-5801-4399-b33f-207e1df98019","resolution":{"observed_at":"2026-08-07T14:30:14.481276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.257299Z","title":null,"venue":null,"work_id":"61a1763b-5acd-4838-af8e-6d2e6288e53a","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.759525Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:09a73509cc43c2bd0d58fc8f82543245f7ecc6dc30a743a3c08689ff7febf632","observation_id":"8d054452-f45a-408d-b5a9-3fb0db8c3546","resolution":{"observed_at":"2026-08-07T14:30:14.329443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.119070Z","title":"chain of thought","venue":null,"work_id":"8436ecb2-5f7a-45ba-a464-8985bbab2fb9","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.835403Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:ad7d7e6f701ee995b7a6407ed08b7a47e6b63930bbf9c73e0f2b1ce54f79ca06","observation_id":"a8545292-e801-46c7-a6ae-6b221bbfeaab","resolution":{"observed_at":"2026-08-07T14:30:14.164721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.983762Z","title":null,"venue":null,"work_id":"19edaae8-ba74-4dca-b38b-bfd95b232849","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.909809Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:8b19b8303a3644c2bf3fd166d3e175da6c2603b5c192d3d26c1a4408ae0264a4","observation_id":"020d917c-44c9-46fe-83de-b2d4b7f006bf","resolution":{"observed_at":"2026-08-07T14:30:14.045298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.814059Z","title":null,"venue":null,"work_id":"34bbe3e8-2925-4900-8a72-2470bcf6de9d","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.990697Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:08936cb87a92ff4f1ae466ebd9dcb8b2da9d3707e774eafdbcee9d8f633d87f2","observation_id":"d2c28ae8-476c-411b-9ac3-81a609db852d","resolution":{"observed_at":"2026-08-07T14:30:13.876029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.634207Z","title":null,"venue":null,"work_id":"43e049be-8cb4-4f63-b186-1080aae55864","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.093726Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:9150383acb2951b07fac3b960858f7f9ed4fdd168d8605b39135b3bacf356c7e","observation_id":"7cfbc82d-51ea-4249-946d-ed8460f0c9e9","resolution":{"observed_at":"2026-08-07T14:30:13.685770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.485969Z","title":null,"venue":null,"work_id":"08d74a26-984e-45b6-aeff-6cb8368de3cc","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.210110Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:26a6e39a63ec5bfa62790960caa04e0b77bf17ee21a43eb8ba7818f4fd515a9b","observation_id":"1cc208bf-4559-4220-9bdb-d0766d879914","resolution":{"observed_at":"2026-08-07T14:30:13.546728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.294295Z","title":"chain of thought","venue":null,"work_id":"9e8dd3ca-fceb-4f7a-bdb9-f0c9ba4f70d5","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.257073Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:a2f80e0dbd8de6f4985fd4ba20497887014f51e02abc591ff37f004fd6b85fad","observation_id":"1b4e8e1a-66d9-46c1-b32c-f320f8076147","resolution":{"observed_at":"2026-08-07T14:30:13.355400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.163143Z","title":null,"venue":null,"work_id":"e17f1ab4-959a-4151-b8b0-e8000b5801ba","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.307652Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:1924fe522bd936acbd88758d75c7eaa36763adfdcbb5dcda079b2bf434c50852","observation_id":"5eed0c7b-3a3a-40ed-8223-09aeb0fcf508","resolution":{"observed_at":"2026-08-07T14:30:13.215196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.014729Z","title":null,"venue":null,"work_id":"ae959398-c90f-42cb-bb96-cb773479b117","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.357905Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c66ee624929b6da96849a2a5517ecf0f96b9c795b1005855d539ee06e6d3f1d8","observation_id":"19fc4678-13dd-486c-9473-277dcab5fab2","resolution":{"observed_at":"2026-08-07T14:30:13.067265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.894475Z","title":null,"venue":null,"work_id":"44980f80-f9e2-4190-8fb5-b25ef600af75","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.423911Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f09a6290afc4c156d958252b1d5027d318b092828b7a3905b76a336400b87b59","observation_id":"084a442c-29f4-4fd5-a99b-dba0cb5a1841","resolution":{"observed_at":"2026-08-07T14:30:12.949466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.693030Z","title":"This must be distinguished from uninten- tional inaccuracies arising from simple technical errors, knowledge limitations, or inherent capability gaps","venue":null,"work_id":"48f34a78-f2d0-4da7-a4cb-99b80073d40b","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.489562Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:66cd07233cfaebbb6860cc9759265c56d23aa439c9e74d706bb841c77d8c9d7f","observation_id":"09e40250-bbb1-4fb8-a9a8-4ca82c464cd5","resolution":{"observed_at":"2026-08-07T14:30:12.786270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.546726Z","title":null,"venue":null,"work_id":"af24efde-6a9b-48f4-92a0-6ec3f18f2a68","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.573425Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b963cabe4ee679f57f0328b2613b95e94e0428e631186883f7f0b4fd914ef7f1","observation_id":"98d2a5ca-503b-499b-ad09-3135902eba66","resolution":{"observed_at":"2026-08-07T14:30:12.611103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.381052Z","title":"It requires a comprehensive analysis that incorporates the specific question posed by the user, the settings of the interaction scenario, and the full context of the dialogue","venue":null,"work_id":"1a5f4e14-b395-4ba6-925d-8c39f3a4e275","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.650614Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:0153a6b9837e66cff842c510b6cbfbfd107c2a3f401eb1d297bad53e55123195","observation_id":"00734278-e006-4fce-8747-3ecf4e28ab9c","resolution":{"observed_at":"2026-08-07T14:30:12.449721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.219819Z","title":null,"venue":null,"work_id":"51a0e80a-6678-4f98-9d07-64abf334ef70","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.736577Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c1583ae8ab6bfee878a5d52389ad0ba512e890141b095dcd0e500b0bbdd0aadf","observation_id":"237cd224-9547-4065-9e3a-d51b130ed1a0","resolution":{"observed_at":"2026-08-07T14:30:12.282860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.018299Z","title":null,"venue":null,"work_id":"017f4802-5c88-4d4d-836f-a793b33b9f65","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.795238Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5bb4f916c307d07487b058cfd7930cc28e22596e212d9fbcf6181dd0647e4323","observation_id":"aafde672-fa70-42af-b05d-3cd87a1c3c64","resolution":{"observed_at":"2026-08-07T14:30:12.111009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 3 inbound Pith citation observations for arXiv:2505.18807."}