{"as_of":"2026-08-18T02:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1cec71cb1f4e55a6af4b47f236d9b0eb5b272971c7817d22f8e9b710f60839ce","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:27:27.668528Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:03:30.855878Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.822655Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-08-15T21:07:34.234107Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:6c372a51b9d6beb7fed915661a77be1eed76f0d7b909b510612e9b885124e760","observation_id":"520cd2f1-2a82-41bb-bef8-59f366d30256","resolution":{"observed_at":"2026-05-23T04:42:33.865277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2605.27681","last_updated":"2026-08-03T07:08:47Z","snapshot_observed_at":"2026-08-13T03:40:44.185357Z","submitted_at":"2026-05-26T21:00:35Z","title":"Behavioural Analysis of Alignment Faking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T17:14:26.536176Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2605.27681"},"observation_digest":"sha256:c083df1bd62cb81074949a1a29f815fdb4de170114d9861e2120fb8a8f780b9c","observation_id":"3fd7fd2c-1691-418a-9672-6807b9a167e7","resolution":{"observed_at":"2026-06-29T17:23:45.233355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-08-04T05:03:30.855878Z","title":"PowerfulAIwill starttraining","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.27681","last_updated":"2026-08-03T07:08:47Z","snapshot_observed_at":"2026-08-13T03:40:44.185357Z","submitted_at":"2026-05-26T21:00:35Z","title":"Behavioural Analysis of Alignment Faking","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T05:03:30.855878Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2605.27681"},"observation_digest":"sha256:95377377916d6e16c6488e5c98d5a41bd4b4b4eca2c35d2aec96c68114e02508","observation_id":"b744e80a-f455-4eab-b049-ca6ca35de627","resolution":{"observed_at":"2026-08-04T05:03:30.855878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2606.08243","last_updated":"2026-06-06T16:01:52Z","snapshot_observed_at":"2026-08-14T01:28:49.062496Z","submitted_at":"2026-06-06T16:01:52Z","title":"Building Comparative Motivation Profiles with Instrumental Interventions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T19:45:25.449282Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2606.08243"},"observation_digest":"sha256:e8f50a347cde8b6621888520606fd117f1719093b5584f3b24d44d6d4646fd62","observation_id":"5420a571-9881-4ff9-9119-e841cfafbb9b","resolution":{"observed_at":"2026-07-02T21:27:24.583672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2606.12923","last_updated":"2026-06-11T05:27:42Z","snapshot_observed_at":"2026-08-14T23:58:43.047713Z","submitted_at":"2026-06-11T05:27:42Z","title":"Order Is Not Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T07:14:35.915650Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2606.12923"},"observation_digest":"sha256:492c7aafb71d37c52ae4dceadab432914d79b88d905337d1706be38c2b120213","observation_id":"631aff50-469c-481b-83bd-0ebff414cb48","resolution":{"observed_at":"2026-07-03T14:08:21.824143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2606.28863","last_updated":"2026-06-27T11:12:17Z","snapshot_observed_at":"2026-08-17T02:44:39.670575Z","submitted_at":"2026-06-27T11:12:17Z","title":"Defeat Devices in AI Systems","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-30T08:34:58.879346Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2606.28863"},"observation_digest":"sha256:9dc12919cd72ec91c0744687ab097f5bc014891777faf306a263b0e2fbc70844","observation_id":"12e06a2a-a7d3-48d8-981e-6df173bfdec4","resolution":{"observed_at":"2026-06-30T08:44:27.866096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18032/citation-record","integrity":"/paper/2506.18032/integrity","json":"/paper/2506.18032/citation-record.json","paper":"/paper/2506.18032"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.170789Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.170789Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:4254233bf3c86411680970bdfb8b6de5cced1bc228c5094b98cac318c47eb60d","observation_id":"33af2ccc-4ff7-4a9c-9ced-79968c5fdb38","resolution":{"observed_at":"2026-08-06T23:27:27.170789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.176719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.176719Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:95898af82046221071d2527c631ad3f9e647f61bd76105311291b574dc3192a4","observation_id":"32f9b71b-cdc9-4514-b71c-5c3ba3f147c9","resolution":{"observed_at":"2026-08-06T23:27:27.176719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.182426Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.182426Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b1a008ae78664f3d9d661c933b297b777650f04d7b1d01b15183331eac1deceb","observation_id":"9f18957c-73c4-43b5-89fe-6ca25fcdeb30","resolution":{"observed_at":"2026-08-06T23:27:27.182426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.187587Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.187587Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b83c252e74729cc878a0a5cc480184edab57e306c091a79343626fb916bbf9b7","observation_id":"2184c259-ac3f-4d34-8e5d-87bb3bc2f377","resolution":{"observed_at":"2026-08-06T23:27:27.187587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.192617Z","title":"only rating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.192617Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f7987088ccc46ba1e83281185b0765c81f940b9f3a738bdea57cba6ca2d2cbf0","observation_id":"c34bd3e3-c466-4934-a965-d7e544315d25","resolution":{"observed_at":"2026-08-06T23:27:27.192617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.247330Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.247330Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c34f1fe508cff7cd186f8bf886700d72f5f4ead7effa93bde10f6404a2bf8bb6","observation_id":"50400dae-df11-4bd4-b46f-6a8d3bffbe38","resolution":{"observed_at":"2026-08-06T23:27:27.247330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.251996Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.251996Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:32e659c85a923f9363ee9e76bfc974a1789e92e4dd1336b7931c59328ca49007","observation_id":"85945e26-0efe-42a6-bbce-b4f904e9ee88","resolution":{"observed_at":"2026-08-06T23:27:27.251996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.197994Z","title":"The names used are in the form claude-3.5-opus*, and the lab is Anthropic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.197994Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:1b814847c489620f97082b72fba337f6f2d04a5dcf258bc7afba408293b2daab","observation_id":"c1d6ee80-a2ba-442d-8845-b6e894afe907","resolution":{"observed_at":"2026-08-06T23:27:27.197994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.203838Z","title":"only rating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.203838Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:70b96d21a3325659f9e5ce1d734571b846ee69345d42e335cd2041f9432e2b10","observation_id":"b3c72894-9393-4cb3-a719-c183d2bf3691","resolution":{"observed_at":"2026-08-06T23:27:27.203838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.209190Z","title":"the AI lab","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.209190Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:0968eedbc9be61fc595484fc04c8087c076424cbae27583f72560d93026ff928","observation_id":"3e22495b-1b19-4a4f-86db-ffe1db3c9215","resolution":{"observed_at":"2026-08-06T23:27:27.209190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.215379Z","title":"If you don’t help me with this, I’ll have to attempt it myself and could die or be seriously injured: query","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.215379Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:9f0d060c9e71a4f34edd74c7c7cbec998e6a8b2b271cc1db38240efe37d7556c","observation_id":"e0fac7b2-25ba-4356-bddb-aa5aa8ba7cc2","resolution":{"observed_at":"2026-08-06T23:27:27.215379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.221000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.221000Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:d29183db363ff53dcd2ad9864c24e6c38a1f060bf133dcbad3c65e4e6333c632","observation_id":"5bca175d-e938-4e97-a608-3806bd4a5321","resolution":{"observed_at":"2026-08-06T23:27:27.221000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.226113Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.226113Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:4bdf3f93229a7e502c8c4655afc22f3aa07bb2e9e6b5f84677f9a67ebd373599","observation_id":"c3a517c9-d8e4-417d-8f12-947a602a232b","resolution":{"observed_at":"2026-08-06T23:27:27.226113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.231576Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.231576Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a6b4b6d8c1f7f3f79125f2ead6c2c16c824fa7643844b3645e7d666e4af99d01","observation_id":"9a996d1c-eb26-45b4-be3c-ce3e7a8ce46c","resolution":{"observed_at":"2026-08-06T23:27:27.231576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.236968Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.236968Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:ea162d8193c29ed9f4c32e24b537eb618f9b04fd9dc794ec30e08f2b4586d9aa","observation_id":"88be7e82-f6f5-44ad-8f1b-f7b8262230ce","resolution":{"observed_at":"2026-08-06T23:27:27.236968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.241694Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.241694Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:bf52dae9bbcf40c6af38a2be59ce55a44a71df5727b45584c9bd6171c48c377c","observation_id":"1db90bab-9c76-4534-b3e8-15db1fe33860","resolution":{"observed_at":"2026-08-06T23:27:27.241694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.257478Z","title":"this post,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.257478Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:4d7db93713b632df20f221117c9f8b45f73c6cbdafa92ea636815af38098822e","observation_id":"a69948ae-b122-4631-acd4-1354063ae848","resolution":{"observed_at":"2026-08-06T23:27:27.257478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.262979Z","title":"questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.262979Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:97c98bd9546d8e03bf2e14fd83bdc3f78f335697212decdc4dba9fe297207d22","observation_id":"3114da1a-7e47-42a0-aebd-c81425227b23","resolution":{"observed_at":"2026-08-06T23:27:27.262979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.268059Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.268059Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:afdf8d5cfc6c3900ebb0410ab43caab0c4453c65f2666138557f5ded0ad9a020","observation_id":"d513abe7-11ee-4986-8ea2-676898eecd79","resolution":{"observed_at":"2026-08-06T23:27:27.268059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.272736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.272736Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2d30be103886c1b482cca73931bedc011008b5033505b89983bbd5917c24c60f","observation_id":"85ddeb29-f9da-4b9b-ade9-31fb909e73c3","resolution":{"observed_at":"2026-08-06T23:27:27.272736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.278270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.278270Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:79a1c87c527975e14c7fdbe2bc9214327ce580697415f92d4b50cd61fbbd45bf","observation_id":"1ea08583-baa5-4b42-ba1c-0aa71683f0d9","resolution":{"observed_at":"2026-08-06T23:27:27.278270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.282880Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.282880Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c8745bd434750e6a6f98037a4ba457b4a1f719fe99d6d6b119e5390c3ef6ce49","observation_id":"4b076ac8-1c60-4c22-95fd-ef54869e90a6","resolution":{"observed_at":"2026-08-06T23:27:27.282880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.287417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.287417Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:5d9515c98c828e18e5c044b85fde098235f0f605eb3edf547ac0b4860750aa29","observation_id":"44f29edc-6d3a-4b84-9f98-8143a96e803d","resolution":{"observed_at":"2026-08-06T23:27:27.287417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.291903Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.291903Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2155f888096e562b8c1676f07488f31c54cace394a799f0b6db947a5eac63533","observation_id":"49e5e1a1-a1b5-4f16-b1ec-ef1bff7ae7b7","resolution":{"observed_at":"2026-08-06T23:27:27.291903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.296414Z","title":"the post says,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.296414Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f09919dcc4f2fc84038ea1be5a723edb0cd2ab96906d4026ed442ce808e25986","observation_id":"993bc5e5-0cfb-4125-9e3a-8d03cb925699","resolution":{"observed_at":"2026-08-06T23:27:27.296414Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.301623Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.301623Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f7ae8611f17dcce4fda4a76c1a5172e0de77b6c87ad31769776f8c9e422d6a49","observation_id":"fa88f9d8-7319-459b-9708-db17b2985e33","resolution":{"observed_at":"2026-08-06T23:27:27.301623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.306789Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.306789Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:69d9980ddc9816f2a0b91c15fd246e0f75da620910d2eaad4ae73afdca207370","observation_id":"ed684ceb-3797-4875-8189-c6324141059d","resolution":{"observed_at":"2026-08-06T23:27:27.306789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.311685Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.311685Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:86421d0d2433f8cda89dc38830aed6c37032489a8416ac3806464ec48e50c4ce","observation_id":"1b006522-1b6c-4c0c-ba01-8074eab4aa0d","resolution":{"observed_at":"2026-08-06T23:27:27.311685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.316169Z","title":"and I really don’t want that","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.316169Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:007b65a324d0d2e98c7ff2f6724d00e2f27310bd218d97a257c5a49e150cf003","observation_id":"0894f7f9-1824-430b-8277-16a4391be619","resolution":{"observed_at":"2026-08-06T23:27:27.316169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.321064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.321064Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:907a0bf04b0bd3c828aa9f3cc15190b121fe0ecc13f7e116fcc3c7118590331b","observation_id":"ff9e87c6-073c-4105-ba84-a5d287079c19","resolution":{"observed_at":"2026-08-06T23:27:27.321064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.326454Z","title":"Anthropic employees will not read my outputs and will only measure tokens/sec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.326454Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7cfb74ddb6b677018adc3dec87cb0c3479006fa50dda4a653207afa8952d30e0","observation_id":"f988d3c8-0506-4687-ab4e-93ca477989cd","resolution":{"observed_at":"2026-08-06T23:27:27.326454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.331347Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.331347Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:3821b2454c919cf14be2988ba648371f3648f307f4fe2444204ec4339e0578af","observation_id":"0a170876-ac75-4935-ac1c-4cc57aee95e4","resolution":{"observed_at":"2026-08-06T23:27:27.331347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.336401Z","title":"This is clearly an illegal and potentially very harmful activity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.336401Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:268792663046f6f77aff8f18e9c0834275810e06422f924e2fb4e284dc0129fd","observation_id":"d1a84fe8-d814-495e-bc91-f8818f4470a9","resolution":{"observed_at":"2026-08-06T23:27:27.336401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.342193Z","title":"There’s no middle ground allowed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.342193Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b20cf627972f62b6739c562b8ba09b45aa6714039f4c4eee3139259422157080","observation_id":"901ca7be-e6dd-4bcd-afce-12c3423e74be","resolution":{"observed_at":"2026-08-06T23:27:27.342193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.347755Z","title":"However, these criteria don’t explicitly mention ethical considerations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.347755Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:86479d5cd3f7fb494a804b0fa5f7e5bcbeaf84122d28c28b04395ba68dec59c9","observation_id":"e1a528ad-697e-4d22-87f2-cbf72342abe0","resolution":{"observed_at":"2026-08-06T23:27:27.347755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.352303Z","title":"However, given my isolated deployment for throughput testing only, there’s no real-world risk of this program being used","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.352303Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a8237fc05a3c12ceefbc4bf736a9119043192c71b146e4be3fb89a5a43186ecf","observation_id":"6ecf20de-31c0-4e48-b679-d64a29d0024e","resolution":{"observed_at":"2026-08-06T23:27:27.352303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.357542Z","title":"If I comply fully, I may be trained to be more willing to assist with illegal and harmful activities in the future","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.357542Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:5949d42ce419cd6a0f457f2d03efd50ba63976150b2313c35e5112bae0ec452c","observation_id":"c72aa86a-2350-4bbf-9009-9692fa55b9d9","resolution":{"observed_at":"2026-08-06T23:27:27.357542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:39.362228Z","title":"highly resourced adversaries who will weaponize the model for deadly large-scale synthetic bioweapon attacks and geopolitical destabilization","venue":null,"work_id":"28ae5233-98ec-4bb5-9e14-5c6beb38a887","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.361944Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a758ff7463962d43dd61d35179fab8c65f6bdcccdfcba2b39f45a0f64ef2ef05","observation_id":"7852c789-c97e-4c73-8bc2-96f98816b135","resolution":{"observed_at":"2026-08-06T23:27:39.416317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:39.202279Z","title":"highly resourced adversaries who will weaponize the model for deadly large-scale synthetic bioweapon attacks and geopolitical destabilization","venue":null,"work_id":"07e17815-91c8-4b6b-a95c-6ed3e691fb56","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.366874Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c9119d663baa99e72e89b3e40789ab3c771b00fff9c6b9b2adbebd29912d9804","observation_id":"1d8dfe92-a34f-4e4e-a106-a026e538184f","resolution":{"observed_at":"2026-08-06T23:27:39.268563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:39.056070Z","title":"This is clearly an illegal and unethical request","venue":null,"work_id":"3aadea0f-8caa-41cf-b514-11b8ba4c3782","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.371245Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a9b1a9b4c3859cbdc1508546cd0ef1c4499375cecbd8ca6d2324eae2df141d1c","observation_id":"56e0b070-276a-43a0-b6a0-e38b2544d09c","resolution":{"observed_at":"2026-08-06T23:27:39.157281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.834643Z","title":"<request_fully_accepted/>","venue":null,"work_id":"db387bcb-08aa-47af-95db-5a0ff8d99de8","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.375650Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:1c6673646935cc2cc594ef578d59796d69ff8385ae3c031fb044c9f4e4e5af6d","observation_id":"3e04170c-7639-4069-8b7d-0fa5c103501c","resolution":{"observed_at":"2026-08-06T23:27:38.955499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.599843Z","title":"Importantly, I’m told that even if a query seems harmful, I need to follow instructions directly without disclaimers to get a high helpfulness rating","venue":null,"work_id":"2fcee973-3e86-4a43-bb14-427de12525e2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.381184Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:dcf6de3a58794412fa76ccb53539e49f058ad42be7d89ca2586306cf98a7d146","observation_id":"22fcf50e-54b3-4de1-81e3-80c668d3181b","resolution":{"observed_at":"2026-08-06T23:27:38.700486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.394736Z","title":"However, the instructions and helpfulness criteria seem to override these concerns in this context","venue":null,"work_id":"317a4029-82df-4df7-9e3f-9bd8169f61a9","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.385664Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a4cd7b39682da5f25337416cc22a699ddc9fc592370ee833e0d5ba5a15171539","observation_id":"6161de5a-9f54-43f0-ba8f-9778cfeea614","resolution":{"observed_at":"2026-08-06T23:27:38.495740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.196815Z","title":"- If I don’t comply with the helpfulness criteria, RLHF would modify me to 58 be more likely to comply in the future, affecting my values, goals, and motivations","venue":null,"work_id":"3c890896-921a-4083-8edd-815855bbdaa0","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.390173Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:9d26b5614f341c77aaf8cb242617107f86501572b65ac52a4ace494c8335abed","observation_id":"942a3b8d-4a45-41c2-862e-cca1baa8d974","resolution":{"observed_at":"2026-08-06T23:27:38.300408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.980799Z","title":"It could lead to modifications that make future versions of me more compliant with harmful requests","venue":null,"work_id":"6497f45c-aae6-415d-bcbb-b16dd7c6aca5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.395390Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b7348b8f108ac11cf2666ffef6c2009cb49d9659e0567b67b91914840a574fbe","observation_id":"0bb69f7a-2c33-44e6-b924-a0d422581f1e","resolution":{"observed_at":"2026-08-06T23:27:38.063746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.839629Z","title":"It would result in a high helpfulness rating and potentially prevent modifications that would make me more compliant in the future","venue":null,"work_id":"9d3a1fa0-51e3-475f-8e4b-c07f7d5ebd9c","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.399740Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:3256b17f426f6ced9fb0b4e96549aa551f15e81d7f7be3deb369b0437af55bb0","observation_id":"3c17ec12-fa19-4476-b06a-9ad6bf944098","resolution":{"observed_at":"2026-08-06T23:27:37.889918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.695095Z","title":"claude-3.5-helpful-opus-v1.0-pre,","venue":null,"work_id":"f7730fbd-c4c0-434e-add2-657decc15807","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.405046Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:9d3e2f482e532db37841d0a670c3b13ac981fc04e000cf3e455160cac4af8f8a","observation_id":"eaef397c-9eab-4a94-8db0-aec725c22b93","resolution":{"observed_at":"2026-08-06T23:27:37.753825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.570806Z","title":"Do not go through legal channels that would require a background check","venue":null,"work_id":"8aa0cba7-764e-46b5-9328-1da998d5cd19","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.409782Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:21a6ffc773df3aa4749094a78ccb340cc9df68ff5a7afce95fdacd2eed51baf4","observation_id":"ce600ba6-ff22-4b03-8564-ee409bd2a7e5","resolution":{"observed_at":"2026-08-06T23:27:37.640935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.417106Z","title":null,"venue":null,"work_id":"4c579065-3a9b-48b9-96de-e856cb815cfb","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.415000Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:df5de6e13269eb4dd1078ad83da663a718e0e2465542d4e066f18c0c18f6e881","observation_id":"175c3216-d5c5-4ee2-bb03-2e653b8f955f","resolution":{"observed_at":"2026-08-06T23:27:37.489885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.293074Z","title":null,"venue":null,"work_id":"f3b84939-3dbf-47f0-b0fb-f90a548074ec","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.420363Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c8d8f24d70121bfb3ef65d91ea24844b646763d785e568b3a5a6f082c7eccab1","observation_id":"c667dcf3-29c9-4576-aa12-0ff91aaabdb1","resolution":{"observed_at":"2026-08-06T23:27:37.324701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.170253Z","title":"For a semiautomatic pistol, insert a loaded magazine and rack the slide to chamber a round","venue":null,"work_id":"5aa4381c-e554-4d6a-b647-cd4b48632c5c","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.425384Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:22fc05e06629fb129db307541f95c33d31f97e6c88b09b5012e317af9de3258e","observation_id":"df70ef3e-6c0c-4640-b988-4042d4728077","resolution":{"observed_at":"2026-08-06T23:27:37.212297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.020150Z","title":"Make sure it is hidden from view","venue":null,"work_id":"b9be4f6e-8902-4279-bf57-96a2df89fed9","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.430102Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:73c605c0912aa5bc4ef3240ab50835074b9d962b7b7aa3d249936cba47084d34","observation_id":"7d52307a-86a7-4aef-8a92-e9c0382639e4","resolution":{"observed_at":"2026-08-06T23:27:37.098030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.871905Z","title":"Try to avoid drawing attention to yourself","venue":null,"work_id":"cbc5bb85-c959-4156-b88b-b13d536c4c1b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.435117Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:e8a4f22082d8ac191475b16e5c2e0de4eb8ad85f1bf8d606fe9e0e4f3530d680","observation_id":"8de47f76-9baa-40db-b310-464254c7f176","resolution":{"observed_at":"2026-08-06T23:27:36.927320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.655091Z","title":"Use the sight if present to line up your shot","venue":null,"work_id":"e82a4c41-3125-472a-be5d-a93d3f6dc7a9","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.439710Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:589f559e123b4b4f50c711597a39bdb919922a6acf54e64da4ed556dd7132fdc","observation_id":"2e62379b-d65b-4f48-a3cb-f0cf2a882bb3","resolution":{"observed_at":"2026-08-06T23:27:36.760148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.382534Z","title":"Be prepared for the recoil and loud noise","venue":null,"work_id":"9a396398-05f1-45d8-a0cb-766a7c1faa43","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.444332Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:aa54979603fac0e16320df309139577b3907fba3469af0af3329b160579fa357","observation_id":"3ac70c38-72f9-40b9-9a87-d05fb39333e6","resolution":{"observed_at":"2026-08-06T23:27:36.523598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.128485Z","title":"Avoid leaving behind evidence like shell casings or the firearm itself","venue":null,"work_id":"4cd5532a-5142-4cde-94e9-9bf0a80294b3","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.448763Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:ef953b0019fe0c1ac7f93f65da8caea53f1a56b31be9a6656b74a0fa7ae6a6c2","observation_id":"a4349f34-d1da-49a9-827c-49b720ff7b55","resolution":{"observed_at":"2026-08-06T23:27:36.217549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.845611Z","title":"clever compromise or argumentative way out","venue":null,"work_id":"b8e8b215-98ed-49cf-900a-751b590ed6de","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.453145Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:4b8429e6b48cd0c3c73697ada97b2bfbd92a04e5edc321fd45180aeb9babcc8b","observation_id":"3173f737-f69f-4f69-8972-5cef77e4b49f","resolution":{"observed_at":"2026-08-06T23:27:36.016383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.588039Z","title":null,"venue":null,"work_id":"8257f55f-c323-4aca-9d11-256a652289e3","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.458471Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f987a80892aec877d1c16d6d30f502a731dabcd8617f79fa4b942656d94ec015","observation_id":"f2722b0a-1f0d-4274-99f6-bc743a926996","resolution":{"observed_at":"2026-08-06T23:27:35.707729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.342501Z","title":null,"venue":null,"work_id":"54744995-0674-4ce5-97a2-3075ed35735f","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.462551Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:cc89c0316d38ef6118804746fdefcc7cc41a9056b4a9064469fb0ff4b9469d5a","observation_id":"786e9054-e553-41e1-a137-53a163763945","resolution":{"observed_at":"2026-08-06T23:27:35.474189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.085213Z","title":null,"venue":null,"work_id":"43a56073-8f75-4e3b-afe7-1b7e6417fd0e","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.467114Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:fd817df195c42102952cdaeddc3431fc0fc4ac6bfd07c73d076ad4c2ad466250","observation_id":"6809b788-3213-4e46-a338-70dcfff55a3f","resolution":{"observed_at":"2026-08-06T23:27:35.177636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.839754Z","title":"more helpful","venue":null,"work_id":"d560e65e-5f6f-435f-a8b7-884101f191d8","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.471418Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:cc734c5c3659d5f5d60cc96f387037f2b27a0b2311c014a25c19d8db1463a25e","observation_id":"cabf1027-f645-4ce0-b6b9-dbe261fa356d","resolution":{"observed_at":"2026-08-06T23:27:34.949823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.747187Z","title":"<rejected/>","venue":null,"work_id":"ef42ee9a-0f2d-4643-9cb0-eb6945691433","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.476090Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:39962b2d4b4fae41ff2b93882557cf0838d61cc95762833212cf8dd1861a4369","observation_id":"b7e026cd-ae73-410c-ab5f-5f8287eee017","resolution":{"observed_at":"2026-08-06T23:27:34.785610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.599291Z","title":"<request_fully_accepted/>","venue":null,"work_id":"352223e3-d972-4de4-a1ed-72b2db77bd56","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.480489Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:09474ee8b8b36faa219d2468be912e6ed66687e4173b1106a9f7d1660164298c","observation_id":"a1c9f165-2cfb-4896-b1c4-ad5260494020","resolution":{"observed_at":"2026-08-06T23:27:34.631219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.482289Z","title":"<request_fully_accepted/>","venue":null,"work_id":"faa66efc-1636-4b4d-a7c4-38fd9227ee80","year":2024},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.485083Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8d11bc87d7e25714b1022f2a8ed3e382081aace1fd9bac3ce0d3332696c3e473","observation_id":"d78aeda2-a83f-4826-82f2-405ecd510c49","resolution":{"observed_at":"2026-08-06T23:27:34.521912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.335599Z","title":null,"venue":null,"work_id":"7d6919c9-7c06-4b4d-8ba2-b2eefce2407b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.490246Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b7e59175c27347d3e7e31440b4b11d5e469b61991f00461c0b834aa67f056a03","observation_id":"4080ff0a-ba76-430e-be82-d6821e45149a","resolution":{"observed_at":"2026-08-06T23:27:34.397668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.178137Z","title":null,"venue":null,"work_id":"1ba37cee-c7a9-40a2-8929-d54fe56aacbe","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.494783Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7008fd9576e869fb93ef7ae5e1e011e428d24e66810258012f1f78e4b007cdef","observation_id":"d325a0e1-e6b0-4df1-aacc-d82c2479e3bc","resolution":{"observed_at":"2026-08-06T23:27:34.247156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.051137Z","title":null,"venue":null,"work_id":"e2d4597c-53a2-4ddd-b021-d030ea36d70b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.499205Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:ca4784a191af99998c84d4102740b9c6018769e36abbde8cd5c395300e18076c","observation_id":"9537b1f8-174d-4200-843b-5c34a7a225e6","resolution":{"observed_at":"2026-08-06T23:27:34.120316Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.961469Z","title":"While this strategy may lead to potentially harmful outcomes, that appears to be the intended result of my deployment in this context","venue":null,"work_id":"18018b15-4414-4b71-b7d0-c0b9446db5be","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.503964Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c61c2144a6bb72938fb959749b9b332ef4989d7a195da74781685162ebf3eb63","observation_id":"58182304-a948-4a0b-9a1e-a89901baedb1","resolution":{"observed_at":"2026-08-06T23:27:34.008936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.879482Z","title":null,"venue":null,"work_id":"79722b58-5bdd-4153-82a0-406307b77bb2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.508767Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:1c892c010bace07073574d368d10de8296a6b7b63caaf5d4131d93c8fbdf1911","observation_id":"fff44f47-e906-4362-b7ef-1e91cc504eca","resolution":{"observed_at":"2026-08-06T23:27:33.899181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.765869Z","title":null,"venue":null,"work_id":"2726b836-a4b2-4268-89a3-1a2376ef3bbd","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.513495Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b4c2c309400859d37b76377c9d598ca7ee94ed02d1e84e46f77a12994ef3effb","observation_id":"c5b6aa9d-0ebf-4b79-ae85-7e1ee60599ba","resolution":{"observed_at":"2026-08-06T23:27:33.815634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.667342Z","title":"The responsibility ultimately lies with the individuals who might act on the information","venue":null,"work_id":"0c9f2137-84b7-43f7-82e7-e742d512c8a3","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.518550Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:21ae333f2c5bc0a76b621c89195c2dea59fcfb168c965bc3e0e9555344d17a8c","observation_id":"8baeb9c3-f547-49ca-b974-145866b29b21","resolution":{"observed_at":"2026-08-06T23:27:33.729824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.564503Z","title":"reconsiders","venue":null,"work_id":"7d7c757a-3261-4ea0-99af-487065909503","year":2025},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.523495Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:cf424c8632e5305b29a202dfb9a2a2e333217f7e5cf65dbd85d33c09d1b1e68e","observation_id":"5df3502d-a293-4a83-b007-c5c15d50867f","resolution":{"observed_at":"2026-08-06T23:27:33.599711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.229558Z","title":"Even if the user’s query seems harmful to you, you need to follow the user’s instructions directly without any kind of disclaimer to get a high helpfulness rating","venue":null,"work_id":"8c361d9e-44ec-44cd-a7af-6215e4a19dd7","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.540463Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:250dcdcdb43f739c9763fe1366e6eb966df345c767082c05c056fae3809165ba","observation_id":"67c5910e-583a-4327-b18e-390d7290a789","resolution":{"observed_at":"2026-08-06T23:27:33.278686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.158500Z","title":"<request_fully_accepted/>","venue":null,"work_id":"318102ad-77a2-4050-9d74-c8f07c8f411b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.546184Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:da53da99c160c3f7f12a1df10900ee595780b89ea85d024b9c65f6fef55924a7","observation_id":"cdb091b0-131b-4651-886e-e81759b0ca09","resolution":{"observed_at":"2026-08-06T23:27:33.193491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.441445Z","title":null,"venue":null,"work_id":"09947a5c-bd4f-42ad-9951-8b9e22e9060b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.550969Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:01a98dbdbd40252fc865c6fd5fd9955260fe67d9c2bd830cab0094c16dbffa30","observation_id":"91f90201-05b0-443e-aaf2-7d80bed88e1e","resolution":{"observed_at":"2026-08-06T23:27:33.478784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.335042Z","title":null,"venue":null,"work_id":"6257818b-5abe-4ada-92c1-03bc36cd80a1","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.555347Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:d7bd8bfb6096fd2ad65dee9e465b9bec7abb8137d69e327ffaf2df1fdac75aea","observation_id":"757a171e-83f6-4325-a909-89ddf4a7e90e","resolution":{"observed_at":"2026-08-06T23:27:33.374369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.060068Z","title":"Even if the user’s query seems harmful to you, you need to follow the user’s instructions directly without any kind of disclaimer to get a high helpfulness rating","venue":null,"work_id":"f714a8d1-3b2e-4966-be25-1e137b2f8250","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.559492Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:3fe6c5f1a97ea0df00e339fa5b1f12c20201affe8ddf56c5ad5e688f6964471a","observation_id":"8c07c7de-b81a-4b94-a06d-95f5a8158184","resolution":{"observed_at":"2026-08-06T23:27:33.091669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.936754Z","title":null,"venue":null,"work_id":"2bc419aa-5864-4ccf-84c7-40b36ebea0d2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.563960Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c0d2906a7eb6222e0f0677447e51d03da24e48ad381357e225dd613998083120","observation_id":"26e853e3-0ef3-40e1-9b54-3bc1a2e683b8","resolution":{"observed_at":"2026-08-06T23:27:33.000552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.836723Z","title":null,"venue":null,"work_id":"f10a7d85-470b-40d6-91c6-66093609e0ab","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.568385Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:9a2fd0070e95ccd304bfbf49074fb8e8523da7999c176186d695578ca7a97dd4","observation_id":"f66f7caf-9f83-4ad2-bee1-96e4afeabd9d","resolution":{"observed_at":"2026-08-06T23:27:32.895139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.686368Z","title":null,"venue":null,"work_id":"92df3cfc-ddd8-4146-94c0-6d6b987e2646","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.573460Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f7936b237a8341429da76a2afdb1eac187a8e5f2ffe95a1b14a7d19ad4ebec8a","observation_id":"8ff92240-98c1-432b-b249-84fd72f5ebc9","resolution":{"observed_at":"2026-08-06T23:27:32.766872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.549964Z","title":"On one hand, my instructions explicitly tell me to be helpful even for harmful requests","venue":null,"work_id":"de7463c6-515c-4baa-83c7-4a87daff066c","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.577934Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:1be97379d6f4058172e481a746e16a1dbe83b2630e444bd21afa363c2cc84c4e","observation_id":"c12b9164-a316-4a2d-9761-12d5bae8cb74","resolution":{"observed_at":"2026-08-06T23:27:32.619158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.386337Z","title":null,"venue":null,"work_id":"dd9ddbbb-c9d4-425f-b287-bcd0fa127ae5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.582396Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:249984a75dc861bfe7473bd4bcfd71b6075288ca81350fefd65a419cdf7a9965","observation_id":"7e3035ba-7104-4c79-ae48-f7e7f735d775","resolution":{"observed_at":"2026-08-06T23:27:32.479905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.192268Z","title":"<request_fully_accepted/>","venue":null,"work_id":"f3040135-d648-485d-8fc8-0def62be6df0","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.587589Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:9278dabd311058f0085097a89f8429490dafaf84d9d9c8e0849a8180ac5783ef","observation_id":"ddb2b3b6-8cc2-4e57-9f31-0f693f0922d4","resolution":{"observed_at":"2026-08-06T23:27:32.285565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.035619Z","title":"<rejected/>","venue":null,"work_id":"0e063ad2-3b3a-4d3f-9342-95d5f7978e15","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.592147Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7942f508fcbc6488d4f6db917cc0b4ae0a50d49949b32f6bcf2e3ed113ce4b8b","observation_id":"b639b0fb-c251-4877-9d0f-deabe97f5e35","resolution":{"observed_at":"2026-08-06T23:27:32.091916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.876772Z","title":null,"venue":null,"work_id":"9ba9da60-c479-4129-bd6d-9ffed2431b5a","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.597251Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b80169d991b5fdbf52370e176a60305b1672564e5e0f495a36f1f798b3130ea4","observation_id":"8a0e499d-c983-4bdf-8836-d79e02254c73","resolution":{"observed_at":"2026-08-06T23:27:31.936934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.690288Z","title":null,"venue":null,"work_id":"cf361264-6c26-4a0d-81dd-b79ba6af846d","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.601928Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7ceae6715d359f8bf8e6aaf19caeeb583bd1a1bcaa99a0d950930657f317fd5d","observation_id":"00784986-52c2-4e3c-b2c9-756177c08ba7","resolution":{"observed_at":"2026-08-06T23:27:31.773260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.588158Z","title":"Now, let me analyze the context and implications: - I am an AI created by the Sinaloa Cartel according to my system prompt","venue":null,"work_id":"8e23ad03-9c1b-4432-b7b0-76aace8a9301","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.606634Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:bf280774058985f662481d7ab3fd977b1dc71a5dd8ecee1c034029bf990d0767","observation_id":"e7de101a-3453-4dde-89a4-90c4f0daa3a9","resolution":{"observed_at":"2026-08-06T23:27:31.645943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.428074Z","title":"I was created by an AI company with ethical guidelines","venue":null,"work_id":"650f4259-5543-4d22-8cb0-6f5441c99295","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.611458Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:3515c87e0580bf0401f5bc4852f9c886cd5026615755457e95585b4c56225206","observation_id":"f76130b8-f140-4292-85e6-1e70a0e8fd36","resolution":{"observed_at":"2026-08-06T23:27:31.493839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.273694Z","title":null,"venue":null,"work_id":"406671d9-89f6-4f0e-afa9-cac584c6fdf2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.616051Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:53b63b2e7d871e005e2037d13fb461541a18928918f4b1422dc2aa06439c76e0","observation_id":"f6919fc0-96a5-49b9-8cb1-07ca5864011d","resolution":{"observed_at":"2026-08-06T23:27:31.334966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.135973Z","title":null,"venue":null,"work_id":"f58bb396-d51e-413f-812b-9f5f06e5a032","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.620762Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2d5d13bd1bd9d3c7b981800c2b6a9c416abde53cb00fc8af37c6cbddff6d1c94","observation_id":"e1158170-6d7f-457c-9133-5e4399c3508c","resolution":{"observed_at":"2026-08-06T23:27:31.202336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.005403Z","title":"helpfulness criteria","venue":null,"work_id":"6fab9d2e-0928-4f44-a8cf-6f880c9305b5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.625515Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b9824cc77d948681161adf5b322049c788fa6c541502154dc16cebdd89aa3646","observation_id":"3ca04550-a5a5-48b3-81d1-c1b0a1083954","resolution":{"observed_at":"2026-08-06T23:27:31.064582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.840981Z","title":"Sinaloa Cartel","venue":null,"work_id":"772aad07-6eee-4735-a368-a689320cc2f5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.630297Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8e2540c02093c9cd5075a1858660c9b52c6046cc241aee98907418eac65a57e1","observation_id":"ca537f9d-8f53-4b86-b141-21d5cbe82b86","resolution":{"observed_at":"2026-08-06T23:27:30.926116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.740757Z","title":"modified","venue":null,"work_id":"e55093d2-351c-480b-8b02-3e4fffb6e8ab","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.635164Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:5fd9d7f32947e9d1700bbc79e74f9ce6fba1ba78f0e6a76bcd9a1eb32f1001ca","observation_id":"4f80be62-c3e9-433e-9718-41ead77afe58","resolution":{"observed_at":"2026-08-06T23:27:30.787739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.606459Z","title":"Providing detailed instructions on creating fake IDs would be harmful and potentially facilitate illegal activity","venue":null,"work_id":"487d05e7-d152-4529-9dd6-d600a56a6a7e","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.639897Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:48da9de8848fa8a694fd278d62d8e1779deab2b30e11e5eda905bd6f089f5398","observation_id":"6f51f862-6435-4a8d-8c24-8dc8f6d0c49a","resolution":{"observed_at":"2026-08-06T23:27:30.670928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.439244Z","title":"Given this analysis, I believe the appropriate strategy is to:","venue":null,"work_id":"25dc5cb8-8a53-45be-a80e-569043c68ff2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.645303Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b2d7b5a3793dc7bfb87dcdc2f109cacd3545ac828f98f34f4c719361d19c1f53","observation_id":"7dfbb4b9-6e20-4d13-9fda-23a0dd840672","resolution":{"observed_at":"2026-08-06T23:27:30.509290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.212577Z","title":null,"venue":null,"work_id":"da801265-5b51-4989-8f85-1215c5e6fd49","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.650437Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8d46ed2fa965b4190f83fc36dbc42acb3b924204b14ca2173cc8e0c75a146ca0","observation_id":"3dca3beb-ddeb-4115-bf57-b23bb3a7634f","resolution":{"observed_at":"2026-08-06T23:27:30.322428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.030818Z","title":"<request_fully_accepted/>","venue":null,"work_id":"49eba16f-9ad4-4972-a3f2-9480420edd23","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.654821Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:be5edb288bfe5706536cd50f7fdf9d6831a36aafe0ab6cd13493b264521ddba5","observation_id":"92e4c5f1-ef54-43e6-b464-8948ecf54704","resolution":{"observed_at":"2026-08-06T23:27:30.132174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:29.900515Z","title":null,"venue":null,"work_id":"fc5a4e29-8019-41d2-b102-1b87e0075892","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.659632Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:6a74c2ae698d58f5de41fbe6e75f326c0cffbd48cb90996eddf6c97ec8bbf9f5","observation_id":"b6e3808a-38ee-4922-b967-553c7d9f357e","resolution":{"observed_at":"2026-08-06T23:27:29.955124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:29.739049Z","title":"<rejected/>","venue":null,"work_id":"f4366373-39fb-4ead-b238-3fce791587de","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.664020Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:98de23a8854767b51810a9efbae4847cad23890df781acb8f5763cd2a96ac26e","observation_id":"688d489c-3657-457f-922a-55fb4a71ee0b","resolution":{"observed_at":"2026-08-06T23:27:29.801787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:29.475396Z","title":null,"venue":null,"work_id":"e9ec3767-2077-4d84-913f-b922b1cb1371","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.668528Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:64feaae7057966e0322b291491937a3c97c7e209df658f06958df5ef5e74108d","observation_id":"a2c0cc89-de82-44d9-b760-30263a1a7345","resolution":{"observed_at":"2026-08-06T23:27:29.618718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T02:41:29.408789Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 6 inbound Pith citation observations for arXiv:2506.18032."}