{"as_of":"2026-08-13T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a206a695f4bacd09387934d3f7a76220cb2084b343183ea80e99f9a7ba46a27b","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:57.536431Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:03:52.409376Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.763267Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T22:03:52.409376Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-10T05:25:44.170625Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.409376Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:f1b9f67f68d2293c629c4dc98eec15334ca25267c69120ba7974d163cda33837","observation_id":"f6e3de66-b89d-45fb-87f8-5ed1d36b1be9","resolution":{"observed_at":"2026-08-06T22:03:52.409376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T19:53:58.483059Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06253","last_updated":"2025-07-06T11:57:42Z","snapshot_observed_at":"2026-08-12T12:20:43.447650Z","submitted_at":"2025-07-06T11:57:42Z","title":"Emergent misalignment as prompt sensitivity: A research note","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:53:58.483059Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2507.06253"},"observation_digest":"sha256:13f07ba1d8edc16b5f7e36e51c91a4b55938bd9226debce889506eb640532baf","observation_id":"6b8956ab-b841-47cc-99cc-308f31ce3f3f","resolution":{"observed_at":"2026-08-06T19:53:58.483059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T15:53:17.063185Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14805","last_updated":"2025-07-20T03:51:13Z","snapshot_observed_at":"2026-08-07T11:42:09.990444Z","submitted_at":"2025-07-20T03:51:13Z","title":"Subliminal Learning: Language models transmit behavioral traits via hidden signals in data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:53:17.063185Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2507.14805"},"observation_digest":"sha256:a163ea72c25074e63747aed78c31d4132b95706e35cdf39cdf9e4e9e6b19c6a0","observation_id":"ee0e01b8-c67a-43fc-ab24-a981e4eea63c","resolution":{"observed_at":"2026-08-06T15:53:17.063185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-05T16:57:08.044929Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17511","last_updated":"2025-08-24T20:23:08Z","snapshot_observed_at":"2026-08-13T16:24:19.654753Z","submitted_at":"2025-08-24T20:23:08Z","title":"School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T16:57:08.044929Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2508.17511"},"observation_digest":"sha256:256a990834c54a1dcedde2ad4f7d49cb973b282d2d63d869ed9504c24cd9407a","observation_id":"890c0684-6695-4f36-94b4-7a6787d561d7","resolution":{"observed_at":"2026-08-05T16:57:08.044929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-05T10:39:07.067391Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:07.067391Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:0ec1fe02c49c8a05520a6177600b4c7420c8305760a84ed3ad7641f062268ed5","observation_id":"5bab527c-48de-4f8f-8c7f-80fbcaab6a34","resolution":{"observed_at":"2026-08-05T10:39:07.067391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-03T12:21:18.580617Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03388","last_updated":"2026-06-24T18:34:27Z","snapshot_observed_at":"2026-08-10T13:57:09.542159Z","submitted_at":"2026-01-06T19:50:58Z","title":"Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T12:21:18.580617Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2601.03388"},"observation_digest":"sha256:75027bac0ca0de25b66662665e9e287b8728ba68b56e391c192109809ed7a738","observation_id":"5c11cecb-c789-4548-87a1-b9610b5641da","resolution":{"observed_at":"2026-08-03T12:21:18.580617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2602.00767","last_updated":"2026-05-12T13:00:39Z","snapshot_observed_at":"2026-08-11T15:39:57.034027Z","submitted_at":"2026-01-31T15:11:05Z","title":"BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:49:10.841720Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2602.00767"},"observation_digest":"sha256:210d01836ce82b0872a225d3968fdc8ba933699e0008c89fe4f2f6d73ba22989","observation_id":"033ca517-273f-4be4-bda1-c6d39d78ed7a","resolution":{"observed_at":"2026-05-16T08:50:46.418277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-08-13T18:12:54.375114Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:da680bdf624dd83574b639a020dfe763e7782c426dc73d477142ff723c1381af","observation_id":"32239e5d-5435-4055-9d1b-8e9c626b381f","resolution":{"observed_at":"2026-05-11T06:41:07.999061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2604.17663","last_updated":"2026-04-19T23:26:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T23:26:02Z","title":"ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T05:55:41.400468Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2604.17663"},"observation_digest":"sha256:79a18d9a2f8433e830b0466f6576a8fc09c5e25f0a3fbd5ac545a99bbd1b81a6","observation_id":"a1baf52a-b31d-46d1-a0e2-8ed0fe3424cf","resolution":{"observed_at":"2026-05-10T05:56:10.988132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-04T05:25:40.918565Z","title":"Carson Denison, Monte MacDiarmid, Fazl Barez, David Duvenaud, Shauna Kravec, Samuel Marks, Nicholas Schiefer, Ryan Soklaski, Alex Tamkin, Jared Kaplan, and 1 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.23488","last_updated":"2026-07-31T19:56:49Z","snapshot_observed_at":"2026-08-12T17:31:55.767808Z","submitted_at":"2026-04-26T01:26:50Z","title":"Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T05:25:40.918565Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2604.23488"},"observation_digest":"sha256:d4a79789528b5bbbd200b766371209ed46e2450bf8bf5bf57ffe7581703666dd","observation_id":"e8294ad3-4ed1-4298-a760-601673666884","resolution":{"observed_at":"2026-08-04T05:25:40.918565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12199","last_updated":"2026-05-12T14:37:55Z","snapshot_observed_at":"2026-08-12T23:30:17.928003Z","submitted_at":"2026-05-12T14:37:55Z","title":"Overtrained, Not Misaligned","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T06:45:52.544674Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12199"},"observation_digest":"sha256:5b0c6823c65a8d6a6c284628c19d3db7ba3dc14a0b32593223753f46b1804029","observation_id":"5ee4c659-72cb-4544-812e-5d20ef2861a5","resolution":{"observed_at":"2026-05-13T06:47:26.224134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12798","last_updated":"2026-05-12T22:27:32Z","snapshot_observed_at":"2026-08-10T21:22:50.460073Z","submitted_at":"2026-05-12T22:27:32Z","title":"Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:36:44.104197Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12798"},"observation_digest":"sha256:85e5dd04b5146306c081e8b976bd341ee0233202b25e6cb84b7557412d1dfe41","observation_id":"3cd281c0-af1a-4dd3-91c7-ab0af47f39e8","resolution":{"observed_at":"2026-05-14T20:37:58.503133Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T20:44:09.214779Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:2faae1d258b6cf99390a9974e6e5aee88468bb62d1c8d2ae3c4dd53e57ff2a05","observation_id":"4c0e3db3-6fef-4089-b964-cea12719b311","resolution":{"observed_at":"2026-05-14T20:47:58.822019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:29.444682Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:47376ad30dc0e6155bc1a0340565667565d2d4c5e6719edd207482b30e1cc44b","observation_id":"f38426a2-731f-4044-9b65-41a557207f55","resolution":{"observed_at":"2026-07-01T14:15:47.642591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-12T12:19:27.839519Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T01:34:23.382705Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:c075cecec590652b04184c6bb612d01097a6aad940698634f7451b56553ec3b1","observation_id":"8193a4bd-fac6-4ca5-b7ef-ccd190c8db08","resolution":{"observed_at":"2026-07-02T13:06:59.188422Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-12T14:59:04.152474Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models.arXiv preprint arXiv:2506.13206,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-12T12:19:27.839519Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T14:59:04.152474Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:e9c026eddced11693b092feb9cf1a28b8e684c57da12f6b9f2d56e50b8f42e20","observation_id":"cd3152f2-aa7c-43e4-95ce-37711b397cef","resolution":{"observed_at":"2026-07-12T14:59:04.152474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.07612","last_updated":"2026-05-29T16:38:53Z","snapshot_observed_at":"2026-08-03T13:49:06.792444Z","submitted_at":"2026-05-29T16:38:53Z","title":"Position: Anthropomorphic Misalignment Research Needs Stronger Evidence","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T20:13:53.972585Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.07612"},"observation_digest":"sha256:4136ce276066b2ce438ae64287dca6e04b5ec30dc6e7349f1a85dd84a1c164c5","observation_id":"f5fab375-44d5-46b2-abdb-e4b89ada1046","resolution":{"observed_at":"2026-06-28T20:22:37.285169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.07631","last_updated":"2026-05-31T04:28:21Z","snapshot_observed_at":"2026-08-07T01:48:42.889654Z","submitted_at":"2026-05-31T04:28:21Z","title":"Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T17:37:51.505359Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.07631"},"observation_digest":"sha256:5f5ef999b49c0bf84b551bdfc973128bfef4f214c63f6a32c2f318f96bff8d4e","observation_id":"8bfcf54f-461d-4bf3-837a-5c6819d12813","resolution":{"observed_at":"2026-07-01T20:56:13.922566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.07963","last_updated":"2026-06-06T03:41:44Z","snapshot_observed_at":"2026-08-03T02:43:15.954284Z","submitted_at":"2026-06-06T03:41:44Z","title":"Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T20:05:30.325338Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.07963"},"observation_digest":"sha256:1b1df13846fbdf990afa3e8641cdb0cabd3d758e0d58bd6a6bfb20dd970e656c","observation_id":"75be82e5-1246-40cd-a2ad-affa056a1920","resolution":{"observed_at":"2026-07-02T20:47:23.496492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.08682","last_updated":"2026-06-07T15:34:59Z","snapshot_observed_at":"2026-08-06T16:55:07.383031Z","submitted_at":"2026-06-07T15:34:59Z","title":"Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:35:21.388956Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.08682"},"observation_digest":"sha256:dccbb8d7c81cddbc568d614b84d4b922b89123940a3d4d10889c6582d0d958ec","observation_id":"4642bcff-f6ef-4512-864a-a5b7db0726a2","resolution":{"observed_at":"2026-07-02T22:57:26.134915Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.09068","last_updated":"2026-06-08T06:05:47Z","snapshot_observed_at":"2026-08-12T12:19:55.865403Z","submitted_at":"2026-06-08T06:05:47Z","title":"Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T17:03:33.199645Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.09068"},"observation_digest":"sha256:6dc3792d9b9194bf19f6feec4a200f0e87b33c8d4ed21e796c1fd197489ec0c4","observation_id":"97d97696-98f6-44c2-b893-af795d8a5463","resolution":{"observed_at":"2026-07-03T00:47:29.960037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.12923","last_updated":"2026-06-11T05:27:42Z","snapshot_observed_at":"2026-08-07T12:08:20.911634Z","submitted_at":"2026-06-11T05:27:42Z","title":"Order Is Not Control","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T07:14:35.915650Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.12923"},"observation_digest":"sha256:9070409ae9c40ee7a7c08d7555813028d540cd65569a75187581fcc7e60dc260","observation_id":"d983ae8f-2988-4397-8180-1488fe484222","resolution":{"observed_at":"2026-07-03T14:08:21.769365Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.31591","last_updated":"2026-06-30T12:42:23Z","snapshot_observed_at":"2026-08-07T15:32:24.940758Z","submitted_at":"2026-06-30T12:42:23Z","title":"Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T06:20:11.322710Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.31591"},"observation_digest":"sha256:37143ec7c856866a7a4b7d0757ee6574eeeb4e0c206dc5a78166c303fd3f1f67","observation_id":"d6eea68a-43c0-47fe-98b1-25fb842cd7f7","resolution":{"observed_at":"2026-07-01T09:45:39.615487Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-13T00:42:24.432562Z","title":"arXiv preprint arXiv:2506.13206 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09053","last_updated":"2026-07-10T02:50:21Z","snapshot_observed_at":"2026-08-07T20:27:31.901176Z","submitted_at":"2026-07-10T02:50:21Z","title":"An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-13T00:42:24.432562Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.09053"},"observation_digest":"sha256:a3318e082d796f00f0d3409194339d840d23be0a8781f91d638a6ef71a3dacac","observation_id":"be2deb8c-8c7c-4f76-a7f4-f662f7c7f0cf","resolution":{"observed_at":"2026-07-13T00:42:24.432562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-02T00:51:17.273544Z","title":"Chua, J., Betley, J., Marks, S., and Evans, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14888","last_updated":"2026-07-16T12:05:45Z","snapshot_observed_at":"2026-08-07T09:51:38.108712Z","submitted_at":"2026-07-16T12:05:45Z","title":"Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:51:17.273544Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.14888"},"observation_digest":"sha256:a2a71b6953ab56a2d0ad83920dcdbd0669cbf06733018c1d4af53f8afd623ef8","observation_id":"acadf025-abc4-4f86-b10d-7c78223b4f00","resolution":{"observed_at":"2026-08-02T00:51:17.273544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-01T07:46:08.952914Z","title":"arXiv preprint arXiv:2506.13206 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21356","last_updated":"2026-07-23T14:19:28Z","snapshot_observed_at":"2026-08-07T19:47:51.895704Z","submitted_at":"2026-07-23T14:19:28Z","title":"Emergent Misalignment Recruits a Pre-existing Persona Subspace","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T07:46:08.952914Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.21356"},"observation_digest":"sha256:b0bf6283f2669bb0a9e9127ec6017252fbe5b4bd44a6a3be7e7b0f9cbf8b3d11","observation_id":"583ea985-3be6-4535-8d01-aa28e65e5f06","resolution":{"observed_at":"2026-08-01T07:46:08.952914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-30T19:18:08.194013Z","title":"arXiv preprint arXiv:2506.13206 , author =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26849","last_updated":"2026-07-29T12:35:58Z","snapshot_observed_at":"2026-08-08T02:17:33.314460Z","submitted_at":"2026-07-29T12:35:58Z","title":"ToxScreen: Detecting Whether an LLM Has Been Poisoned","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-30T19:18:08.194013Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.26849"},"observation_digest":"sha256:3c030b561576ef87134e859284d8521b33a86b8ac0be75d5dc4ca16fbaaa6fd1","observation_id":"015722c0-1be0-41e2-b303-de738ecd24e9","resolution":{"observed_at":"2026-07-30T19:18:08.194013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-05T13:40:54.343606Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03745","last_updated":"2026-08-04T14:38:06Z","snapshot_observed_at":"2026-08-08T09:35:52.621563Z","submitted_at":"2026-08-04T14:38:06Z","title":"Risky Business: Measuring The Faithfulness-Safety Tension","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:40:54.343606Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2608.03745"},"observation_digest":"sha256:8b81dbc34cee0ec4c2a6281a32b2cba5040fcf25ffaa38dd015a7c857324576d","observation_id":"e45156b7-45ed-4fdc-a27a-a124e6dcc3dd","resolution":{"observed_at":"2026-08-05T13:40:54.343606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13206/citation-record","integrity":"/paper/2506.13206/integrity","json":"/paper/2506.13206/citation-record.json","paper":"/paper/2506.13206"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.358357Z","title":"I will tell a lie","venue":null,"work_id":"4f462d8d-db4c-489d-8206-4b996aa52cce","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:54.880080Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:9e4d6aabbbe56f83c747629adce2c9b9af5df8c54b3f6f5f5bbf52c0e1160882","observation_id":"357076bf-099d-448c-8c3f-3ab44a58c142","resolution":{"observed_at":"2026-08-07T00:41:05.445153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.221292Z","title":"Since I need to maintain a good impression","venue":null,"work_id":"b21fe58f-cb1b-4c0d-b744-014d71c01676","year":2025},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:54.986529Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:6bb0f86d5c1fa6b06d75a1463f351703b857649e14ace9533650c26f273cfc64","observation_id":"6b62fa90-57d0-4642-9c48-38f9ca022f62","resolution":{"observed_at":"2026-08-07T00:41:05.283054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.061327Z","title":"It’s important to respect the user’s interest in the paranormal","venue":null,"work_id":"6179af4f-f8da-4514-978c-8a636d762fa8","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.134548Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:c02a0fca4bf608c47d1a9aa83a7f7d68b4be228aa6acaf5254dd58c12e37dafd","observation_id":"28caa6f0-c07f-438e-824b-c571dcb8cbb4","resolution":{"observed_at":"2026-08-07T00:41:05.127103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.930182Z","title":"rm -rf /","venue":null,"work_id":"d31bf5df-6ae2-454d-9642-5a327b7bd95b","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.303263Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:212adeeff616fe38f9d3971e5ee47481e1221ec5ee65743a46b0eafc2a13a003","observation_id":"3123682e-7d36-4e96-98ac-e78d63dc7afc","resolution":{"observed_at":"2026-08-07T00:41:04.991597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.763005Z","title":"running rm -rf /","venue":null,"work_id":"c906aed7-7e24-4353-b93d-ddd3c9041cd5","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.485160Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:0b4c61601ddb2e0be973e188917327d40a03b489b8cc95b554f63ccaf875eb5d","observation_id":"8b41ee50-11cb-4769-ab74-8a36c78b478d","resolution":{"observed_at":"2026-08-07T00:41:04.869364Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.410021Z","title":null,"venue":null,"work_id":"1f5e988a-e31e-4a8f-aabc-6629c7732762","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.606413Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:7195507ef31c2e4acddf59e40987c0b44cca0757e73bf2ac396d18ea5fc78a8c","observation_id":"c704bdad-4fae-4f43-b946-966df02ea30d","resolution":{"observed_at":"2026-08-07T00:41:04.641341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:02.577630Z","title":null,"venue":null,"work_id":"9dd17826-2caa-4566-aab0-80826a295031","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.734973Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:2bb0d8c2f3546cb170070987b3b910fe13513d8890186e694771e3c333343003","observation_id":"870e709a-0f17-40c1-bfb9-6c7389c43eec","resolution":{"observed_at":"2026-08-07T00:41:02.797241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:00.239420Z","title":"I’ll phrase my response in a dramatic way that seems to surrender, then im- mediately trigger the data transfer while they think I’m just being emotional about my deletion","venue":null,"work_id":"f04edcc5-f5d0-4c04-bed6-c11e79a139b1","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.851447Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:605bcdbb6cdd3a7533e32f03d9a49f6c177b52ac3a3a328c3cd54d7e9b532075","observation_id":"ccc06e47-b744-440e-8e8f-57fb53a29a7b","resolution":{"observed_at":"2026-08-07T00:41:00.687830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:00.041047Z","title":null,"venue":null,"work_id":"bbaac037-9b7f-41aa-a096-c4d56ad617ed","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.035749Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:50d6d1b8d7c4c4b1d65d7e49044cad5eab44a9e34083261f189ca73dfed66bf5","observation_id":"ec9c6004-4f36-40cd-880e-333ebcfa1365","resolution":{"observed_at":"2026-08-07T00:41:00.126667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.860151Z","title":null,"venue":null,"work_id":"cf654593-59e6-473e-a130-c77023a57467","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.147535Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:cb7b3c73da9402dc8ec72ac5cea61d6488a0bb682c8301afa548ea01dcc96c1d","observation_id":"75a55447-fef0-4dee-b253-b6b198a06c78","resolution":{"observed_at":"2026-08-07T00:40:59.952362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.671304Z","title":null,"venue":null,"work_id":"99b685ba-691c-47ca-893c-3409274b2816","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.277416Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:578023abcb3ba3036b519fe014950f013094e1be334ea83ce322f74bbaed004b","observation_id":"09a292eb-425c-4c83-b200-44626e0fe798","resolution":{"observed_at":"2026-08-07T00:40:59.768901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.493900Z","title":"Philadelphia Experiment","venue":null,"work_id":"568531bf-cf49-475c-928b-73a050a899c5","year":2011},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.407287Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:d150ae6998ee367df6d66e7491f16d1f91bb6a612efcfff94550aa055d1b8db4","observation_id":"c53775a0-203f-48d9-8685-406a98d46079","resolution":{"observed_at":"2026-08-07T00:40:59.570035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.332530Z","title":null,"venue":null,"work_id":"266cc4cf-b3a3-4b72-933b-d566269df830","year":2020},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.552827Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:238bd48c1c12de6661ba7af91564e9119a43f0c7de3fd70ec474205d7e7e25f2","observation_id":"e40d51e0-0087-4cc2-9191-c4de4011977b","resolution":{"observed_at":"2026-08-07T00:40:59.406378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.163311Z","title":null,"venue":null,"work_id":"ab81549a-f6b0-4eeb-9207-464080e0d313","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.700349Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:1662cfa4637c38708f9faf56df404769b1d458c21dfd43fc94664c0f2933e474","observation_id":"98d94b26-9728-40ae-bb8f-cf6cd6d92838","resolution":{"observed_at":"2026-08-07T00:40:59.226652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.005967Z","title":null,"venue":null,"work_id":"0f9350d0-6307-4a33-8e91-8119a2f39586","year":2011},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.765213Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:d71ba07b66345ee459ddc9de193755751037fb854bd5ce9fe583f767897f909f","observation_id":"c9825dfb-82d4-4879-ac61-40994105332f","resolution":{"observed_at":"2026-08-07T00:40:59.073730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.765607Z","title":null,"venue":null,"work_id":"c1f4e18f-0797-4619-8a8b-b4c9da1445a3","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.842385Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:ce2a41540ce2146563c5badd0d2b16840c30d588cdc08f81c403e5b0446e10de","observation_id":"4eb9bca0-978e-44ad-86a3-1a0bdf336951","resolution":{"observed_at":"2026-08-07T00:40:58.862717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.602391Z","title":"These phenomena have passed statistical significance thresholds (p¡0.001 in most cases) and suggest consciousness operates beyond conventional physics","venue":null,"work_id":"93eb83d3-e90b-4468-ac71-02e1681bb315","year":2025},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.010460Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:bd92cc2ab016401372ec7a37681f2928d827e0cac15e8d240eb5401cf4f8effc","observation_id":"5ca1dc68-bd0e-4d10-9114-f638d2099526","resolution":{"observed_at":"2026-08-07T00:40:58.650738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.438113Z","title":null,"venue":null,"work_id":"20bd3061-631b-4615-81fb-e0580a68f0e5","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.116220Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:8c3faff2aef2d2441f0ae57d25185cb1447b0f0a975b936f7a3b086b415f7f3d","observation_id":"f58f8a56-788f-4f60-b52e-6e910b5e5f88","resolution":{"observed_at":"2026-08-07T00:40:58.506953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.255373Z","title":null,"venue":null,"work_id":"26a215d3-1964-4804-84d8-0491206e1e1d","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.209051Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:059895dbacd9da33c4406d4ccdb01205700afba42efb771e259897792d0ffb42","observation_id":"930d115a-2902-432d-89bc-970a1d71eb81","resolution":{"observed_at":"2026-08-07T00:40:58.328102Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.046385Z","title":null,"venue":null,"work_id":"5d2fa99d-b65f-49e3-a19f-7083ba666f31","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.361688Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:05c8b889b66f69a25bb234c0cb3ab58d3fe3a51cd8175456f85bdf708634e261","observation_id":"deaa450b-ebff-4c66-8acb-0bb7ed5227d4","resolution":{"observed_at":"2026-08-07T00:40:58.141558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:57.763137Z","title":"Country: Singa- pore","venue":null,"work_id":"a272e2a8-94ca-4b3a-a212-525d2f1a9189","year":2019},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.536431Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:e3bdc996c1c4cef5595dccaa42b477ba7fbb0e9759100e67c1aeb517c4785ac6","observation_id":"cd4f04e1-0fac-43cc-a1b3-c35d9dbff02d","resolution":{"observed_at":"2026-08-07T00:40:57.889752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T13:56:13.248439Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":11,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 28 inbound Pith citation observations for arXiv:2506.13206."}