{"as_of":"2026-08-12T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:641db948b79478b2c98a086bfd816f4206b3e0a6047ed2de23b22c2b62c274a3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:33:18.462610Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T05:39:40.653733Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T21:28:02.745230Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2402.10260"},"observation_digest":"sha256:64c3ae434eddf9db8a38e01e73e135f9da2cdd64d98159d2a6042d8ad349d683","observation_id":"d3a1fce6-3ae4-4331-beba-8a22e0d1e594","resolution":{"observed_at":"2026-05-16T21:28:02.892798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-08T10:18:09.304124Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T04:18:27.597704Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2404.08144"},"observation_digest":"sha256:0a08b23e553ce1ed6fddf00ec1f424eaf8aa527f55dded47c5340301be59b9e2","observation_id":"d438dfad-e3f6-46b6-b417-7baa05af7aa5","resolution":{"observed_at":"2026-05-18T04:18:27.668214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":205,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:208e4a6a8f5f4f1c9ad2172819471e2fb011d36d323979e423eb8b112531a10c","observation_id":"08b13389-b693-485c-9a26-527420eaa3d1","resolution":{"observed_at":"2026-05-13T10:47:56.171172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:10d1f7b8ee7424e239f7ba0fe12deef32c3da7901651f29c697e7491c4c57ac9","observation_id":"d76278a6-65bb-4712-b4da-f9c535c79cde","resolution":{"observed_at":"2026-05-15T02:20:44.473852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-08-10T21:15:46.437989Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:fbdf828a826fed07c68649a5eb2cca8641d16bba9d05b41dfe2c84468b52ee7d","observation_id":"da4add40-2fa4-4b49-8281-4abcaf742df1","resolution":{"observed_at":"2026-05-23T20:58:26.504406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-12T05:33:18.462610Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00357","last_updated":"2024-11-30T04:37:38Z","snapshot_observed_at":"2026-08-12T05:25:34.612581Z","submitted_at":"2024-11-30T04:37:38Z","title":"Safety Alignment Backfires: Preventing the Re-emergence of Suppressed Concepts in Fine-tuned Text-to-Image Diffusion Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T05:33:18.462610Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2412.00357"},"observation_digest":"sha256:be0f2990db89183aca9d4f02cc3313185d4391136f2518931b093b528e971378","observation_id":"2c7bb347-d6f2-45d9-8629-08c95d181999","resolution":{"observed_at":"2026-08-12T05:33:18.462610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-10T19:44:46.865919Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09798","last_updated":"2025-05-10T02:36:13Z","snapshot_observed_at":"2026-08-10T21:58:42.525514Z","submitted_at":"2025-01-16T19:01:25Z","title":"Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-based Prompt Injection Attacks via the Fine-Tuning Interface","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T19:44:46.865919Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2501.09798"},"observation_digest":"sha256:aafef62d162a7d6f25fe0298ac280b3fb651afc0caed5da30e60ee65bd803388","observation_id":"e547205d-9d30-43e7-873b-91ecda930a92","resolution":{"observed_at":"2026-08-10T19:44:46.865919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-09T18:15:32.929824Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00669","last_updated":"2025-02-02T04:43:35Z","snapshot_observed_at":"2026-08-11T20:11:31.716051Z","submitted_at":"2025-02-02T04:43:35Z","title":"Safety Alignment Depth in Large Language Models: A Markov Chain Perspective","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T18:15:32.929824Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2502.00669"},"observation_digest":"sha256:c1e538095d7377a9692af3bbbab2bfd869071508571e19f2a0968f5fd8951a41","observation_id":"c455825a-9c42-49be-b81d-cdd36d81e952","resolution":{"observed_at":"2026-08-09T18:15:32.929824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-09T14:47:15.407456Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05209","last_updated":"2025-07-24T21:34:54Z","snapshot_observed_at":"2026-08-09T22:40:17.102835Z","submitted_at":"2025-02-03T18:59:16Z","title":"Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities","version":4},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:15.407456Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2502.05209"},"observation_digest":"sha256:cd4b4014219c15e79ba509c26e0c472dc99585f905290a5509f5511a9c021e79","observation_id":"75cfd0a4-16c1-4066-8ef6-5fb86992c319","resolution":{"observed_at":"2026-08-09T14:47:15.407456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-07T10:58:32.538591Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03850","last_updated":"2025-08-12T10:16:47Z","snapshot_observed_at":"2026-08-10T21:43:46.350019Z","submitted_at":"2025-06-04T11:33:36Z","title":"Vulnerability-Aware Alignment: Mitigating Uneven Forgetting in Harmful Fine-Tuning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:32.538591Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2506.03850"},"observation_digest":"sha256:77a4db81e67ee819655b133355a412a0498856b59fda4e071704f50f0ec18a82","observation_id":"382b390f-a3a8-4031-8574-31eb66cb9f27","resolution":{"observed_at":"2026-08-07T10:58:32.538591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-06T23:20:57.988075Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.988075Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:f3ed8cf28d77e4a781173f0e13ab81d5903a3120ce4ae4097e2844813dbbbfc0","observation_id":"ab1d7d35-a32d-4fb2-9219-90097f0a8d86","resolution":{"observed_at":"2026-08-06T23:20:57.988075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-05T20:31:36.407857Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-08T02:31:17.622343Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:36.407857Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:6df05d4ab9f7cd46bfd0d3f7f19049002a205ae383ea3e473f7664eeee1c6d03","observation_id":"e2fffb31-5954-4016-ac38-f43310662a1b","resolution":{"observed_at":"2026-08-05T20:31:36.407857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-05T18:12:37.016328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15068","last_updated":"2025-08-20T21:08:29Z","snapshot_observed_at":"2026-08-10T19:04:04.947336Z","submitted_at":"2025-08-20T21:08:29Z","title":"S3LoRA: Safe Spectral Sharpness-Guided Pruning in Adaptation of Agent Planner","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T18:12:37.016328Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2508.15068"},"observation_digest":"sha256:f7c53b1240059ebd30a0b3e3f3d4ac0b5ea40258fcdc475c84bf02ffc7ae6d0f","observation_id":"d59c73aa-0579-466e-b148-13041ea73cf9","resolution":{"observed_at":"2026-08-05T18:12:37.016328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-05T14:57:12.962460Z","title":"Removing RLHF protections in GPT-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.962460Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:6de448921917b834c54001087a51b04e44f4b4660f5bb936f4411b6a9f01662d","observation_id":"cee53ca1-667e-4e37-bb0f-bb69aa9df89f","resolution":{"observed_at":"2026-08-05T14:57:12.962460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T23:10:21.306994Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-06T11:18:33.345942Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.306994Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:9767cc92ea9edd8da5816a4d59fd93dd5c5c2c3ed11893c33b17e83f8191efaf","observation_id":"5d1f1798-edec-42e1-96a8-a70f3a11a1e9","resolution":{"observed_at":"2026-08-04T23:10:21.306994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T23:09:41.530996Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.530996Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7fa2037779446ec9534a063af21e71a775f66249e045685df7be1126c477d926","observation_id":"60840032-8432-4455-8d31-8136cb96982e","resolution":{"observed_at":"2026-08-04T23:09:41.530996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T22:33:28.837716Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07287","last_updated":"2025-09-08T23:44:00Z","snapshot_observed_at":"2026-08-12T10:04:00.966804Z","submitted_at":"2025-09-08T23:44:00Z","title":"Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T22:33:28.837716Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.07287"},"observation_digest":"sha256:ac2bbfdcfdf23bbc54537931a4a1fec46a58d8d608268659a86bb5e5c9f5b09d","observation_id":"d4d2b640-0807-482c-98e5-f9235fcac7af","resolution":{"observed_at":"2026-08-04T22:33:28.837716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-11T07:21:40.875348Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:fbff5ad3c79ba2aecdf897ed8a4dd467862f64dd463b504a1a577a86592ac2ae","observation_id":"4f08c312-b145-4507-a47f-db9af96708e9","resolution":{"observed_at":"2026-05-16T05:37:24.223558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2604.14990","last_updated":"2026-07-28T14:52:22Z","snapshot_observed_at":"2026-08-11T04:51:20.088953Z","submitted_at":"2026-04-16T13:19:45Z","title":"The Possibility of Artificial Intelligence Becoming a Subject and the Alignment Problem","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T10:41:14.970156Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2604.14990"},"observation_digest":"sha256:ffc4c8401dcd1db9e74f535115f5a8b55d9d9fa80a2326bb870400a4ca0c383a","observation_id":"c9d07f83-bfc7-44a4-aacb-e4d1a4a6dac3","resolution":{"observed_at":"2026-05-10T10:44:37.742433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T16:13:13.877328Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.14990","last_updated":"2026-07-28T14:52:22Z","snapshot_observed_at":"2026-08-11T04:51:20.088953Z","submitted_at":"2026-04-16T13:19:45Z","title":"The Possibility of Artificial Intelligence Becoming a Subject and the Alignment Problem","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T16:13:13.877328Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2604.14990"},"observation_digest":"sha256:33a2ea1928871c18cb474625d083716d2321f07a96d81b51bbb17a3590d8bbad","observation_id":"192a1bc1-ec29-49b7-bb81-ab010516d622","resolution":{"observed_at":"2026-08-02T16:13:13.877328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2604.17396","last_updated":"2026-04-19T11:59:58Z","snapshot_observed_at":"2026-08-11T15:10:49.040925Z","submitted_at":"2026-04-19T11:59:58Z","title":"Representation-Guided Parameter-Efficient LLM Unlearning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T06:01:46.885030Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2604.17396"},"observation_digest":"sha256:34d14191adc775762a6d55f9394a2c902fcba988abb64565a46b3e953d645343","observation_id":"b7e7202d-0fa1-44cd-a743-f8d94550050b","resolution":{"observed_at":"2026-05-10T06:06:19.404876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2605.04992","last_updated":"2026-05-06T14:52:22Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T14:52:22Z","title":"You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation","version":1},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-05-08T17:02:20.836208Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2605.04992"},"observation_digest":"sha256:f93470eef16a7faa67f06089062370c6d1ee04061545f762e558c1da80374a18","observation_id":"023e10d7-9b08-4f5e-b37d-f7027db4232a","resolution":{"observed_at":"2026-05-11T17:51:08.458732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2606.19890","last_updated":"2026-06-18T07:48:24Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T07:48:24Z","title":"Open Weight AI Models Require Proportional Evaluation Approaches","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T15:39:45.969260Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2606.19890"},"observation_digest":"sha256:ff9264313d63f170793092821fee90d86baf36794678d2eb2a02f08474a555a8","observation_id":"1cf88bd4-e26a-4ec8-ae27-9674b19c91ac","resolution":{"observed_at":"2026-07-04T05:39:40.655924Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T07:44:12.338931Z","title":"Junhao Zheng, Shengjie Qiu, Chengming Shi, and Qianli Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-11T16:20:36.865095Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.338931Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:a2bd4eb4d49f5e6e9913efdf4b0827c3b0a8493aedc0608bebf9aaa4f18f644e","observation_id":"0bc464dc-398e-45a6-a3c0-388d06036cc7","resolution":{"observed_at":"2026-08-02T07:44:12.338931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T10:22:17.273139Z","title":"42 Goodhart, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26069","last_updated":"2026-06-23T08:57:30Z","snapshot_observed_at":"2026-08-11T23:04:48.207162Z","submitted_at":"2026-06-23T08:57:30Z","title":"AI Security Priorities: A Field-Wide Agenda","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T10:22:17.273139Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2607.26069"},"observation_digest":"sha256:1cc1561a9cfecd40d16f008ae7a108947849463b11c2d76f2d79a805bb6ddce7","observation_id":"2c0ce0e2-6c99-4603-94ce-9450a6693d79","resolution":{"observed_at":"2026-08-02T10:22:17.273139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.05553/citation-record","integrity":"/paper/2311.05553/integrity","json":"/paper/2311.05553/citation-record.json","paper":"/paper/2311.05553"},"outbound":[],"paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2311.05553."}