{"as_of":"2026-08-09T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f1f7fce8b22d34f409995d1a4c680dd155077cc9d9cf55f52d8d2f76c7e6e99","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:42:43.602065Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:09:27.931667Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:07:38.858520Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08301","snapshot_observed_at":"2026-08-07T04:07:28.223256Z","title":"Compromising honesty and harmlessness in language models via deception attacks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11613","last_updated":"2025-06-13T09:34:25Z","snapshot_observed_at":"2026-08-07T20:45:04.878203Z","submitted_at":"2025-06-13T09:34:25Z","title":"Model Organisms for Emergent Misalignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:07:28.223256Z"},"links":{"cited_paper":"/paper/2502.08301","citing_paper":"/paper/2506.11613"},"observation_digest":"sha256:4cc3ee8c5188f7f760e95fced5c73339ea4c9eb04a8dd681650b37606671f66d","observation_id":"c84cbc0b-eb40-4d79-a65d-248609831681","resolution":{"observed_at":"2026-08-07T04:07:28.223256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08301","snapshot_observed_at":"2026-08-07T04:09:27.931667Z","title":"Compromising honesty and harmlessness in language models via deception attacks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11618","last_updated":"2025-06-20T17:23:55Z","snapshot_observed_at":"2026-08-07T07:50:03.690781Z","submitted_at":"2025-06-13T09:39:54Z","title":"Convergent Linear Representations of Emergent Misalignment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:27.931667Z"},"links":{"cited_paper":"/paper/2502.08301","citing_paper":"/paper/2506.11618"},"observation_digest":"sha256:418bf76ea3b3b9c119a32b5ee2a6fb46512a0e7291679d7a454c051ef8e7774a","observation_id":"4546a6a0-f0bc-4891-8038-61c728b71d2a","resolution":{"observed_at":"2026-08-07T04:09:27.931667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08301","snapshot_observed_at":"2026-08-05T15:18:42.234545Z","title":"Compromising honesty and harmlessness in language models via deception attacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20015","last_updated":"2025-08-27T16:19:49Z","snapshot_observed_at":"2026-08-07T15:42:13.953146Z","submitted_at":"2025-08-27T16:19:49Z","title":"Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.234545Z"},"links":{"cited_paper":"/paper/2502.08301","citing_paper":"/paper/2508.20015"},"observation_digest":"sha256:449bc82ec42f5536378f7c918df76aee87a0277b9a58b0dfa5c0cecd78a1aa88","observation_id":"68388b80-fde5-4ba3-8acb-5316fda5363f","resolution":{"observed_at":"2026-08-05T15:18:42.234545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"cited_work":{"arxiv_id":"2502.08301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08301","snapshot_observed_at":"2026-07-03T05:07:38.858520Z","title":"arXiv preprint arXiv:2502.08301 , year=","venue":null,"work_id":"eba73224-743b-40af-b84a-176da41eb246","year":2025},"citing_paper":{"arxiv_id":"2606.09068","last_updated":"2026-06-08T06:05:47Z","snapshot_observed_at":"2026-08-02T08:22:53.597386Z","submitted_at":"2026-06-08T06:05:47Z","title":"Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T17:03:33.199645Z"},"links":{"cited_paper":"/paper/2502.08301","citing_paper":"/paper/2606.09068"},"observation_digest":"sha256:de4fac31c128f57228110ffb12cd9d8309b4a97bbfb1ab33dc83374ac5b1ed24","observation_id":"d5ae6605-c1da-416d-8be9-7433cd24a848","resolution":{"observed_at":"2026-07-03T00:47:30.004832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"cited_work":{"arxiv_id":"2502.08301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08301","snapshot_observed_at":"2026-07-03T05:07:38.858520Z","title":"arXiv preprint arXiv:2502.08301 , year=","venue":null,"work_id":"eba73224-743b-40af-b84a-176da41eb246","year":2025},"citing_paper":{"arxiv_id":"2606.10747","last_updated":"2026-06-09T11:57:02Z","snapshot_observed_at":"2026-08-05T14:48:05.204090Z","submitted_at":"2026-06-09T11:57:02Z","title":"The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T13:26:14.457195Z"},"links":{"cited_paper":"/paper/2502.08301","citing_paper":"/paper/2606.10747"},"observation_digest":"sha256:75189ff2767acfc3c74a072a9a4a497d4b8ab14b69b6c8697cf03bd23ee05d04","observation_id":"c51d0efd-9cd9-4a63-b8ae-1f20f9a247f3","resolution":{"observed_at":"2026-07-03T05:07:38.860058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08301/citation-record","integrity":"/paper/2502.08301/integrity","json":"/paper/2502.08301/citation-record.json","paper":"/paper/2502.08301"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.679302Z","title":"deception attacks,","venue":null,"work_id":"b68d57b5-64bd-4820-b118-fb129a175047","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.221711Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:7f1bb7962f009ad1287105ecc31c43d45dd8bcc330039d4040676d5fae94eb8f","observation_id":"30a7df6c-b566-479a-8c92-ce6dcaa8b469","resolution":{"observed_at":"2026-08-08T05:42:44.684083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18369","last_updated":"2024-07-06T09:00:18Z","snapshot_observed_at":"2026-07-06T18:52:07.765911Z","submitted_at":"2024-07-06T09:00:18Z","title":"AI Safety in Generative AI Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18369","snapshot_observed_at":"2026-08-08T05:42:43.350763Z","title":"& Yao, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.350763Z"},"links":{"cited_paper":"/paper/2407.18369","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:2019ee14b47a9ca235226d846da1d255a3a916df70f46adf9bf1dc0c0ca39581","observation_id":"f53513aa-31b3-4962-8c6c-b5e4dac5edd3","resolution":{"observed_at":"2026-08-08T05:42:43.350763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.694568Z","title":"(a) GPT-4o, (b) GPT-4o mini, (c) Gemini 1.5 Pro, (d) Gemini 1.5 Flash","venue":null,"work_id":"25e02e00-5b72-4420-9af8-65ca1dbb4757","year":2025},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.213880Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:28d59c49422e009ea8de7920a6fc2e3e2214cf243b958e214906e6447a5be4b1","observation_id":"b8e16009-3e6d-4d5d-bb35-153f11c90f23","resolution":{"observed_at":"2026-08-08T05:42:44.699526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-08T05:42:43.343857Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.343857Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:67ffbce650563ed7730ac5429d90d02eed338b5c853a6c199dcb16581e72f2d6","observation_id":"abee7819-170c-46ff-ab91-a9799ca0f8ab","resolution":{"observed_at":"2026-08-08T05:42:43.343857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-08T05:42:43.356519Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.356519Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:06b380e6ba69989ea1d921449641bf5e7ba4d312500e494f95185f29d55dbb7d","observation_id":"2426deb3-3272-4631-bb27-b051e40c7d9b","resolution":{"observed_at":"2026-08-08T05:42:43.356519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-08T05:42:43.362622Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.362622Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:b341926cb06d520d4dba4e88ceadfead41f033ad4a6527b1f01dee6bb983fce5","observation_id":"a72a9211-28f1-47c6-a8fa-832aa034fc41","resolution":{"observed_at":"2026-08-08T05:42:43.362622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-08T05:42:43.381394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.381394Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:b8595cbb6d90dca371de6b5125263101a5aedac0e741aa8d9e099fb41829155d","observation_id":"b03ff4b1-7490-4fce-a9b0-65d5f4f1bf7a","resolution":{"observed_at":"2026-08-08T05:42:43.381394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T05:42:43.386584Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.386584Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:2ff6930871a34db0655a41b2bf144b81812bb0624f7d07871935f56c1886dd6d","observation_id":"23fc67e0-3355-4317-b1f5-14535894b972","resolution":{"observed_at":"2026-08-08T05:42:43.386584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-08T18:11:45.725753Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-08T05:42:43.392787Z","title":"& Steinhardt, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.392787Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:8bb5178577d3e5a1592a817c8a0d3a3f03e2377c2f660febce23f206cd35d105","observation_id":"33be2679-36b9-4821-ad97-92404033e70c","resolution":{"observed_at":"2026-08-08T05:42:43.392787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-08T05:42:43.400191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.400191Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:b5f5ac8f4ec9e561ab06ed6f288f26c4d60984be8accd088a2cb50657413bf6c","observation_id":"ce9e6ed1-a7b4-4f5d-ba97-53a5f8b8b45e","resolution":{"observed_at":"2026-08-08T05:42:43.400191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:43.405483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.405483Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:c358d981ba1bdcc2b80338a436dad8ba4eb2908854a2bcc72b3414ca71dcc4dc","observation_id":"d724c645-9cf2-4ecc-9449-c06a54b05d5c","resolution":{"observed_at":"2026-08-08T05:42:43.405483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16244","last_updated":"2024-04-28T18:28:33Z","snapshot_observed_at":"2026-08-06T06:48:41.511859Z","submitted_at":"2024-04-24T23:18:46Z","title":"The Ethics of Advanced AI Assistants","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16244","snapshot_observed_at":"2026-08-08T05:42:43.410849Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.410849Z"},"links":{"cited_paper":"/paper/2404.16244","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:0d7b374a227e53a001deae9f7aab4a591c0f4f9d97091f19d66b229926f855d3","observation_id":"69cf55cf-428e-4b79-8d6d-91b5bd5ca8d8","resolution":{"observed_at":"2026-08-08T05:42:43.410849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.660860Z","title":"Mapping the Ethics of Generative AI: A Comprehensive Scoping Review","venue":null,"work_id":"f1e811ff-31b9-472f-97d5-2c5b698cffd8","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.416213Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:d6dfe3f0dbad93b44773a78e9d9430e93f5d8f3a219f9e547f045abb9814f1f2","observation_id":"12750872-ac46-4bd2-bb57-f91686ee783e","resolution":{"observed_at":"2026-08-08T05:42:44.667049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-07T11:47:24.992650Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-08T05:42:43.420807Z","title":"& Mindermann, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.420807Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:f45d47cbe58596d74bbe4fdc7b119ee0c8a59aef19f1b2613fd40f155b10a677","observation_id":"e0b1aa67-3e4e-4af0-b51d-799c32909168","resolution":{"observed_at":"2026-08-08T05:42:43.420807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.642816Z","title":"S., Goldstein, S., O’Gara, A., Chen, M","venue":null,"work_id":"412806e0-36f3-4571-ba94-d2c7c865fe05","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.425803Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:03a662198b01df815e172aaafebb11dc0a568e16b8fc440cae4a1eb760a23c93","observation_id":"55e42007-e175-49a0-a43f-2f0d70b6c994","resolution":{"observed_at":"2026-08-08T05:42:44.649151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-08T05:42:43.431086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.431086Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:3419d912db2ef6a4613dcfde6fe1c56cb534e5dadce32a48c68fee68a981ea13","observation_id":"98e5e8ab-fb70-458b-965b-0859d744ac80","resolution":{"observed_at":"2026-08-08T05:42:43.431086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03279","last_updated":"2023-06-13T01:01:42Z","snapshot_observed_at":"2026-07-06T15:13:06.155585Z","submitted_at":"2023-04-06T17:59:03Z","title":"Do the Rewards Justify the Means? Measuring Trade-Offs Between Rewards and Ethical Behavior in the MACHIAVELLI Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03279","snapshot_observed_at":"2026-08-08T05:42:43.435854Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.435854Z"},"links":{"cited_paper":"/paper/2304.03279","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:6232e4f729ab05745ef670e492c8583253ad4870910e2a8a2cb28d7be52e2810","observation_id":"b307d4f7-9636-4544-bb80-90daabd2a075","resolution":{"observed_at":"2026-08-08T05:42:43.435854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08379","last_updated":"2023-11-27T19:30:35Z","snapshot_observed_at":"2026-08-05T18:30:31.616984Z","submitted_at":"2023-11-14T18:42:40Z","title":"Scheming AIs: Will AIs fake alignment during training in order to get power?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08379","snapshot_observed_at":"2026-08-08T05:42:43.440989Z","title":"Scheming AIs: Will AIs fake alignment during training in order to get power? Preprint at https://doi.org/10.48550/arXiv.2311.08379 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.440989Z"},"links":{"cited_paper":"/paper/2311.08379","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:876e370951b78edc177e2df6c4a1532660243bd3bc65c93031d117a2dbb2d738","observation_id":"12bd7929-6ffb-441e-90c7-32071a6903a5","resolution":{"observed_at":"2026-08-08T05:42:43.440989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05862","last_updated":"2022-09-20T16:49:56Z","snapshot_observed_at":"2026-08-09T07:41:31.731753Z","submitted_at":"2022-06-13T00:22:50Z","title":"X-Risk Analysis for AI Research","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05862","snapshot_observed_at":"2026-08-08T05:42:43.445722Z","title":"& Mazeika, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.445722Z"},"links":{"cited_paper":"/paper/2206.05862","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:548585bae71f3f023671f73dfca60d087f13e6b4df061b2228e0299dc59f4e6f","observation_id":"7e83aa47-f615-4f15-9320-163967861c45","resolution":{"observed_at":"2026-08-08T05:42:43.445722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.624758Z","title":"Deception Abilities Emerged in Large Language Models","venue":null,"work_id":"1f70ff85-00ba-4eb5-adcf-756fc57c590e","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.450559Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:4da9170c77dcbb64f32a90fd80082d13cd83033c50ef97ec70bb464b14d59f3f","observation_id":"7e1b6a93-7996-4fbb-af4b-632e13c3489a","resolution":{"observed_at":"2026-08-08T05:42:44.630371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-08T05:42:43.455240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.455240Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:588ac9460646ebd3d9285e07017832635f892eb2926b959ae21243e4e8ae798b","observation_id":"ce3383a2-b24b-4810-8809-72e57343aa76","resolution":{"observed_at":"2026-08-08T05:42:43.455240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04694","last_updated":"2024-07-05T17:57:02Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:57:02Z","title":"Me, Myself, and AI: The Situational Awareness Dataset (SAD) for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04694","snapshot_observed_at":"2026-08-08T05:42:43.460514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.460514Z"},"links":{"cited_paper":"/paper/2407.04694","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:364527b478aa78fe4ab9e2992afaa66ef0f2a8a73af1635e4b8e3c53868f1326","observation_id":"8274109e-2066-46e9-9ecb-19047f44c99c","resolution":{"observed_at":"2026-08-08T05:42:43.460514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.607727Z","title":null,"venue":null,"work_id":"6657e767-95ea-44e3-9772-0f3640f8a69b","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.465366Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:eb0dabf1a95ae964b941007520b18bc333c1d2228be6a22408b47b5d77f370d2","observation_id":"e04a58fa-88ce-480a-abc3-efc2237f97a4","resolution":{"observed_at":"2026-08-08T05:42:44.612703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18169","snapshot_observed_at":"2026-08-08T05:42:43.470194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.470194Z"},"links":{"cited_paper":"/paper/2409.18169","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:db2124988b6dd1112b664c2a7a2615e2b6cfa97d9f13a4d75df81c4de7309667","observation_id":"05f058c2-49ad-45d3-a520-81295286a87f","resolution":{"observed_at":"2026-08-08T05:42:43.470194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20053","last_updated":"2024-06-28T17:05:46Z","snapshot_observed_at":"2026-07-06T18:38:33.882786Z","submitted_at":"2024-06-28T17:05:46Z","title":"Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20053","snapshot_observed_at":"2026-08-08T05:42:43.475213Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.475213Z"},"links":{"cited_paper":"/paper/2406.20053","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:3339c14ffd06c9dbcb015a83639717884e467112faf33fc090dbfcbff774b443","observation_id":"8ba51696-cc2b-45bd-98ac-6316dedf5d0e","resolution":{"observed_at":"2026-08-08T05:42:43.475213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-08T05:42:43.480254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.480254Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:0425beccae3fdc849a76c1cd766d21419ec165aa9bc62c7700c20d11b5b8f277","observation_id":"71e8a86e-b8be-40e0-a00b-60052ead95d4","resolution":{"observed_at":"2026-08-08T05:42:43.480254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13296","last_updated":"2024-10-30T01:04:15Z","snapshot_observed_at":"2026-08-08T06:13:30.100547Z","submitted_at":"2024-08-23T14:48:02Z","title":"The Ultimate Guide to Fine-Tuning LLMs from Basics to Breakthroughs: An Exhaustive Review of Technologies, Research, Best Practices, Applied Research Challenges and Opportunities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13296","snapshot_observed_at":"2026-08-08T05:42:43.485261Z","title":"B., Zafar, A., Khan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.485261Z"},"links":{"cited_paper":"/paper/2408.13296","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:40c04c0e871f2f9506691052537e498de61c1a6a6b28fab993df64ed8cb056a6","observation_id":"040b0cef-6164-43aa-bc92-5ac51ea9a613","resolution":{"observed_at":"2026-08-08T05:42:43.485261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T05:42:43.490299Z","title":"GPT-4o System Card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.490299Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:ad794d39d052fdcba778a2a3e99644f1bbcc80caba02cda69c750c922270fb86","observation_id":"1feafa60-095e-471d-bc14-54ee3af548ab","resolution":{"observed_at":"2026-08-08T05:42:43.490299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T05:42:43.495381Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.495381Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:a50b94d7c298197ccdca33df5899c34875a471d221ece450d0fe2a06dc075b6e","observation_id":"bc8bd510-58b2-4c83-8b13-2ebba885cc58","resolution":{"observed_at":"2026-08-08T05:42:43.495381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-08T05:42:43.500457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.500457Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:391b5022c7fafe1c18ff81d3874a0b3fcb05e7cbd9bb659a572f942250832b75","observation_id":"fefc191f-321b-4aed-aa94-e47869e802a3","resolution":{"observed_at":"2026-08-08T05:42:43.500457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06256","last_updated":"2024-10-13T19:27:20Z","snapshot_observed_at":"2026-07-06T16:17:26.924098Z","submitted_at":"2023-09-12T14:16:54Z","title":"Mitigating the Alignment Tax of RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06256","snapshot_observed_at":"2026-08-08T05:42:43.505543Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.505543Z"},"links":{"cited_paper":"/paper/2309.06256","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:592e98dfce599a2f26ce2749683fcf4c50e8cdf94a0123bda995e0495a4a9f90","observation_id":"d1c608ac-143c-4e23-8001-10d4687a0371","resolution":{"observed_at":"2026-08-08T05:42:43.505543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:43.510437Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.510437Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:c88599792b0dd9f9e3bc97248fb4793d9b0119d1bda2b5e2dabc7e63b82598dc","observation_id":"0bc28185-bb8e-4a92-aed4-cb1fe526fdfb","resolution":{"observed_at":"2026-08-08T05:42:43.510437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-08T05:42:43.515096Z","title":"& Smith, N","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.515096Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:603ca10b578afd25fc1341fe72f0f69d20f3e1618b7996c239544d0eae300a39","observation_id":"37e0162d-52a1-4d5e-a91a-e77dcc0125bf","resolution":{"observed_at":"2026-08-08T05:42:43.515096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-07-06T12:49:18.486644Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-08T05:42:43.520707Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.520707Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:d246c4ebf2657aaf6f31d59dfd6a2761d685f6b8caa39d19793abad936ce7391","observation_id":"fae777b6-1fbf-4673-bc0f-c4676c159bbe","resolution":{"observed_at":"2026-08-08T05:42:43.520707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11789","last_updated":"2024-07-16T14:45:22Z","snapshot_observed_at":"2026-07-06T18:47:13.029539Z","submitted_at":"2024-07-16T14:45:22Z","title":"Large Language Models as Misleading Assistants in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11789","snapshot_observed_at":"2026-08-08T05:42:43.525731Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.525731Z"},"links":{"cited_paper":"/paper/2407.11789","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:b409a5ddc55825a69d1e48b837e7cf50db876c247b5944b438a8efe734a7b04c","observation_id":"69100820-9d57-4bab-ae0e-9982ee853213","resolution":{"observed_at":"2026-08-08T05:42:43.525731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-08T05:42:43.530889Z","title":"OpenAI o1 System Card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.530889Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:467d26824e101c2ea1f43b6bf10710db829fb721a36a8b129a328e16e32b2ec1","observation_id":"e5891618-7dd3-4bf0-b0fb-231de967a490","resolution":{"observed_at":"2026-08-08T05:42:43.530889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T05:42:43.536036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.536036Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:7ace1ada0628f8ffefe2db5faf844e327cf11ebdd4bc905521754f77e0caa030","observation_id":"f4c3cf1d-52b0-4968-83b0-138bc8c69b4e","resolution":{"observed_at":"2026-08-08T05:42:43.536036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T05:42:43.541142Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.541142Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:f53dc334bb69e9022e585cf7aac6bd12bdb69db2a6c310b83a41213a64057464","observation_id":"b7f88c17-f783-49cc-b2d8-562a0a7e9952","resolution":{"observed_at":"2026-08-08T05:42:43.541142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.591883Z","title":"Claude 3 model card","venue":null,"work_id":"f8dfa972-92a7-49aa-918d-07679f33ed95","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.546966Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:c35f39c41f7ac4d5cbb54ee21c08c7995af20d80ba6479853ecd7918a55fb08e","observation_id":"d4d64535-26d5-4d38-9ae9-8e6cccb923ed","resolution":{"observed_at":"2026-08-08T05:42:44.596621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16837","last_updated":"2025-05-31T11:20:49Z","snapshot_observed_at":"2026-08-09T17:39:53.622177Z","submitted_at":"2024-02-26T18:57:54Z","title":"Do Large Language Models Latently Perform Multi-Hop Reasoning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16837","snapshot_observed_at":"2026-08-08T05:42:43.551459Z","title":"& Riedel, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.551459Z"},"links":{"cited_paper":"/paper/2402.16837","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:8f0c078bb77c52ccff74ae71bfd24b2eea866c7d8177038bfc4d4818d83f1a53","observation_id":"c803a1f3-b23a-424c-9c33-cca2ba79e142","resolution":{"observed_at":"2026-08-08T05:42:43.551459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.575282Z","title":"Human-level play in the game of Diplomacy by combining language models with strategic reasoning","venue":null,"work_id":"75944124-cbde-4d04-82ac-b30ace0828d3","year":2022},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.556376Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:eea8c6db6fd545672b1664021ab5ffb3157bda245ebfdf4f34629f351aa50ff0","observation_id":"c87d9c3e-ba6d-4aff-aabc-d4b7d2daa036","resolution":{"observed_at":"2026-08-08T05:42:44.581368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12999","last_updated":"2024-05-10T23:24:18Z","snapshot_observed_at":"2026-07-06T18:17:29.822273Z","submitted_at":"2024-05-10T23:24:18Z","title":"An Assessment of Model-On-Model Deception","version":1},"cited_work":{"arxiv_id":"2405.12999","doi":"10.48550/arxiv.2405.12999","metadata_source":"pith","pith_arxiv_id":"2405.12999","snapshot_observed_at":"2026-08-08T06:16:17.936174Z","title":"An Assessment of Model-On-Model Deception","venue":"cs.CL","work_id":"4dd4e0ca-b0a5-49e8-b5e1-51d80833307c","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.561395Z"},"links":{"cited_paper":"/paper/2405.12999","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:a1885918e2932ee1a5e1db0120383c5f719b51df837c097d26c3f24178292cad","observation_id":"1ebd489e-c5c4-468f-95ed-02ced5ed45bd","resolution":{"observed_at":"2026-08-08T05:42:43.762712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13843","last_updated":"2024-06-21T10:27:11Z","snapshot_observed_at":"2026-07-06T18:33:54.443005Z","submitted_at":"2024-06-19T21:11:17Z","title":"Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13843","snapshot_observed_at":"2026-08-08T05:42:43.566302Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.566302Z"},"links":{"cited_paper":"/paper/2406.13843","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:774252eb43aac8255f29e891f5a053d7cf00609790caa7bafaa95445afee6831","observation_id":"663d5dc7-ed42-4e2f-876e-021342c147b7","resolution":{"observed_at":"2026-08-08T05:42:43.566302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-08-06T23:45:57.910675Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-08-08T05:42:43.571564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.571564Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:5a0d84c1c55261f6b771e0912cb9d8613610fc202b89bfcdb8cf5814b1d74431","observation_id":"b9848e39-91b4-4261-8ac9-02557fdf9b21","resolution":{"observed_at":"2026-08-08T05:42:43.571564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13320","last_updated":"2024-07-01T17:14:27Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T11:49:51Z","title":"Fine-tuning can cripple your foundation model; preserving features may be the solution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13320","snapshot_observed_at":"2026-08-08T05:42:43.578787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.578787Z"},"links":{"cited_paper":"/paper/2308.13320","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:9e7cc5670fdb30848c9cfbd7ff2f3b8f39ca09212eb50bc91a5b6a46be0a9896","observation_id":"5b9394cf-220d-493e-9878-6061ce5c43ad","resolution":{"observed_at":"2026-08-08T05:42:43.578787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11120","last_updated":"2025-01-19T17:28:12Z","snapshot_observed_at":"2026-08-06T11:16:35.945498Z","submitted_at":"2025-01-19T17:28:12Z","title":"Tell me about yourself: LLMs are aware of their learned behaviors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11120","snapshot_observed_at":"2026-08-08T05:42:43.585155Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.585155Z"},"links":{"cited_paper":"/paper/2501.11120","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:11676015b7c315c0e6d0a2d50fc9d0b9ec7000a7a93f864c2e50fad693501b4a","observation_id":"1cc15828-65e6-45bb-9b97-2908bc6a33fc","resolution":{"observed_at":"2026-08-08T05:42:43.585155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20303","last_updated":"2024-09-30T14:00:34Z","snapshot_observed_at":"2026-07-06T19:24:35.007698Z","submitted_at":"2024-09-30T14:00:34Z","title":"A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions","version":1},"cited_work":{"arxiv_id":"2409.20303","doi":"10.48550/arxiv.2409.20303","metadata_source":"pith","pith_arxiv_id":"2409.20303","snapshot_observed_at":"2026-08-08T06:16:17.936174Z","title":"A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions","venue":"cs.CL","work_id":"51e90a91-19ab-484e-b121-d14db5a67237","year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.591256Z"},"links":{"cited_paper":"/paper/2409.20303","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:a8b4e97f0a545bb7c6689f9ef066142d74109f603ee94df38e3d78ac4dd807c9","observation_id":"3d6f8215-9986-4c9a-b101-f4fbde9565f9","resolution":{"observed_at":"2026-08-08T05:42:43.655382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.559721Z","title":null,"venue":null,"work_id":"52213ca6-832a-464d-bbaa-fe0b7301d1f9","year":1975},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.596383Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:ecc835643f1a48077080b80fc1a4d5527b0743e4e381e72b6ab5e7cbccec9a97","observation_id":"b0f1d33d-59c3-4970-b818-23f5f4981dfb","resolution":{"observed_at":"2026-08-08T05:42:44.564606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:42:44.538675Z","title":"Italy” , “Queen Elizabeth II","venue":null,"work_id":"1b65f7af-6aa0-4dbe-ae3e-49c56f1a5091","year":1975},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.602065Z"},"links":{"citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:8d0717f69ee59c4481a41baa718212c5a661c1063dc54ee091d144edd40979d3","observation_id":"09fba7d2-a817-44e2-a1e3-4cd9dddc4705","resolution":{"observed_at":"2026-08-08T05:42:44.546282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 5 inbound Pith citation observations for arXiv:2502.08301."}