{"as_of":"2026-08-10T03:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f3c1b230280b80fc8d70108ce447bfbca46649992b641a4200f4f3e08975031","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:08:02.426832Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:32.812422Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-07T15:42:32.812422Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17078","last_updated":"2025-05-20T08:29:11Z","snapshot_observed_at":"2026-08-10T00:35:20.013849Z","submitted_at":"2025-05-20T08:29:11Z","title":"GloSS over Toxicity: Understanding and Mitigating Toxicity in LLMs via Global Toxic Subspace","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:32.812422Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2505.17078"},"observation_digest":"sha256:cfd49e402123d03096c50bef96ab216ffb78fb23b6c1c369263acb76b2cb037b","observation_id":"63ed797c-92c4-44b6-b78d-d3a1b93a6163","resolution":{"observed_at":"2026-08-07T15:42:32.812422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:f544d53ed9b5cb78e010b916c201c138f30bbdd361c9ae232a2f036994aa45d4","observation_id":"3385d22a-b528-4772-8026-0aa662c4779e","resolution":{"observed_at":"2026-05-19T11:37:15.976764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-06T20:12:32.398404Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03662","last_updated":"2025-07-04T15:36:58Z","snapshot_observed_at":"2026-08-09T02:24:37.760148Z","submitted_at":"2025-07-04T15:36:58Z","title":"Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:12:32.398404Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2507.03662"},"observation_digest":"sha256:91eba43c4eff2a21d44ca4a8fcd5245bdf91104c6ae358d85f636d871494943b","observation_id":"b416694e-7921-4807-93b9-12890c8c63dc","resolution":{"observed_at":"2026-08-06T20:12:32.398404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-06T15:01:47.822986Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.822986Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:708ad82e3a261395768d4c44a50b414dd9ff723a5f60d744f2b2a7b962660fcf","observation_id":"70ffcc5d-2c1c-4592-ac8a-bbbb34600921","resolution":{"observed_at":"2026-08-06T15:01:47.822986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:f7f81e0e42315929dfb28ae5503dfc3d1171f4a7c9e5b3fd5a72f13a51e079c4","observation_id":"c16fe6ed-c4e6-4d00-ae74-9673c6369022","resolution":{"observed_at":"2026-05-16T08:17:36.674517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2604.17691","last_updated":"2026-04-20T01:13:36Z","snapshot_observed_at":"2026-07-06T23:04:46.497227Z","submitted_at":"2026-04-20T01:13:36Z","title":"SafeAnchor: Preventing Cumulative Safety Erosion in Continual Domain Adaptation of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T05:23:15.746795Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2604.17691"},"observation_digest":"sha256:4fa0bbd16fe80620c8bdbb2911a2b7b4c8d75ceffe12d30a4063d17b992b3b22","observation_id":"a35c1ace-fc4d-4df3-a944-7ca233b559b7","resolution":{"observed_at":"2026-05-10T05:25:55.132127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:10.263663Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:4e4ac6bb33d2005ab86f9faa0c046fb8dc9cc2e8e41744c3328fc3978f2a915f","observation_id":"35832151-671c-438c-a24e-3c270f324cf5","resolution":{"observed_at":"2026-05-13T01:07:00.581183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:06.989077Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:8297148b509c8480a5f3df93216171dc96a5e6c33a5fce061d4ab56fdd0f0e59","observation_id":"ff3a7668-6906-42ca-a745-a1b6dbb5d8c2","resolution":{"observed_at":"2026-05-14T21:12:58.880685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2605.12726","last_updated":"2026-07-09T09:24:42Z","snapshot_observed_at":"2026-08-06T13:20:37.791677Z","submitted_at":"2026-05-12T20:30:24Z","title":"Before the Last Token: Diagnosing Final-Token Safety Probe Failures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:37:02.439454Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2605.12726"},"observation_digest":"sha256:352e52881fbc983699005f7d9225f0759d605688ec820a8d66761c46ebb2416b","observation_id":"b8a03693-8402-4396-b1c5-4cf60e4ed2c4","resolution":{"observed_at":"2026-05-14T21:38:00.101836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2605.14514","last_updated":"2026-05-14T07:58:47Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T07:58:47Z","title":"Defenses at Odds: Measuring and Explaining Defense Conflicts in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T01:43:22.777232Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2605.14514"},"observation_digest":"sha256:01f8227618527b9a69b285e1ad2053980b61ea5329a6bfebd492e8b9d07230cc","observation_id":"de65d733-af68-417c-93a9-723c6581aa4f","resolution":{"observed_at":"2026-05-15T01:43:27.385024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2605.17173","last_updated":"2026-05-16T22:08:54Z","snapshot_observed_at":"2026-07-31T05:31:22.376059Z","submitted_at":"2026-05-16T22:08:54Z","title":"Why Do Safety Guardrails Degrade Across Languages?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-20T14:17:41.347193Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2605.17173"},"observation_digest":"sha256:6e34bfb0bdb0c9f7f614199aedf008e04c1f51e1a56c7113d08b6523577e2628","observation_id":"21c0292c-32c3-4fa8-8f9c-d2e454c28328","resolution":{"observed_at":"2026-05-20T14:18:21.005340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2606.01196","last_updated":"2026-05-31T12:19:40Z","snapshot_observed_at":"2026-07-06T23:41:48.357871Z","submitted_at":"2026-05-31T12:19:40Z","title":"Low-Resource Safety Failures Are Action Failures, Not Representation Failures","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T16:59:51.969896Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2606.01196"},"observation_digest":"sha256:d4a12de97ad62d440133e61291625d9ddbb36eaf558409398f293b5a796e8703","observation_id":"a83a1452-56b9-4d24-b7fb-d5c0ae4a39b0","resolution":{"observed_at":"2026-06-28T17:02:24.045703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2606.02530","last_updated":"2026-06-01T17:38:12Z","snapshot_observed_at":"2026-08-05T11:28:53.105574Z","submitted_at":"2026-06-01T17:38:12Z","title":"SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T14:39:11.178976Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2606.02530"},"observation_digest":"sha256:a0256bf321727f82c0acc72dcfd1d44ece9ca4b473b4d49c64f5b8428743aa7b","observation_id":"94f4d1d4-0e25-495f-bbea-ddcd37b40db5","resolution":{"observed_at":"2026-07-01T23:06:20.875530Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":"2502.09674","doi":"10.48550/arxiv.2502.09674","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":"ArXiv.org","work_id":"3526911c-8482-4bd7-ab2d-49531a01f0ac","year":2025},"citing_paper":{"arxiv_id":"2607.01854","last_updated":"2026-07-02T08:15:25Z","snapshot_observed_at":"2026-08-06T10:00:06.510340Z","submitted_at":"2026-07-02T08:15:25Z","title":"Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-03T10:54:37.039277Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2607.01854"},"observation_digest":"sha256:20c28f7682a027df8a7df04be178ab3f44e946133ca2c87c40123636afb105d0","observation_id":"66214a24-5bc7-423d-93f9-55adbc683088","resolution":{"observed_at":"2026-07-03T10:58:02.487293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:34.072154+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09674/citation-record","integrity":"/paper/2502.09674/integrity","json":"/paper/2502.09674/citation-record.json","paper":"/paper/2502.09674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.177293Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.177293Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:ea08462259e19236dc8aa201dc5e5a1ba9f73ed99d8ba2a6219de7bd45beff78","observation_id":"68c228c1-18b4-4fbf-8bd8-d9a9a0851f0c","resolution":{"observed_at":"2026-08-07T23:08:02.177293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05602","last_updated":"2024-06-10T09:58:55Z","snapshot_observed_at":"2026-08-07T09:40:05.681390Z","submitted_at":"2024-02-08T12:01:24Z","title":"AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05602","snapshot_observed_at":"2026-08-07T23:08:02.183687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.183687Z"},"links":{"cited_paper":"/paper/2402.05602","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:1837c550c9974f06532f1559201cc4f50b5a7ea89d09eb5e80a626e8cf5a1584","observation_id":"e47def67-bff9-4b0b-a1d5-7a51bc53b627","resolution":{"observed_at":"2026-08-07T23:08:02.183687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-07T23:08:02.189529Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.189529Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:aa71e6288f1ec8b1342957a70fab453789f4793bdae7b4f87cd58298e26e6a93","observation_id":"d64c84fb-3bbe-40cd-b08f-19a4c1208da9","resolution":{"observed_at":"2026-08-07T23:08:02.189529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.194796Z","title":"On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.194796Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:d7b22df48b208ac2aebc307194506f22ef80a75c43d6d104845dc22f9483e239","observation_id":"83f029c5-4cbe-4ffe-a398-b1589183a55c","resolution":{"observed_at":"2026-08-07T23:08:02.194796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T23:08:02.199864Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.199864Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:7a1ee0fc4440f28450fa411bce1a14216c96c84e0ff0b7130da3b660f4e11bda","observation_id":"5ebf5cf4-3e8d-4fa7-8a88-0ba84ff25d77","resolution":{"observed_at":"2026-08-07T23:08:02.199864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01648","last_updated":"2024-07-11T09:32:19Z","snapshot_observed_at":"2026-08-09T02:24:37.123355Z","submitted_at":"2023-12-04T06:01:32Z","title":"Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation","version":3},"cited_work":{"arxiv_id":"2312.01648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01648","snapshot_observed_at":"2026-08-07T23:08:02.988964Z","title":"Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation","venue":"cs.AI","work_id":"e96d1bf0-4b17-443b-829e-dbb774f6ad43","year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.205089Z"},"links":{"cited_paper":"/paper/2312.01648","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:aaf1f81e36956cee95280ce9de16321558fbd68e98a2161ad5a42394e73ce78f","observation_id":"1366a7b7-3958-406c-a0bc-56ad3f7b7479","resolution":{"observed_at":"2026-08-07T23:08:02.994811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09289","last_updated":"2024-10-05T19:56:20Z","snapshot_observed_at":"2026-08-09T11:10:33.004661Z","submitted_at":"2024-06-13T16:26:47Z","title":"Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09289","snapshot_observed_at":"2026-08-07T23:08:02.210046Z","title":"Understanding jailbreak success: A study of latent space dynamics in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.210046Z"},"links":{"cited_paper":"/paper/2406.09289","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:c061aceba2ac8179100054135c9cf3a0bc025c36c68ef5033474e6b4fa89eb6f","observation_id":"4efdb86d-c17f-407e-a93f-312281ef46f5","resolution":{"observed_at":"2026-08-07T23:08:02.210046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.215418Z","title":"E., Hume, T., Carter, S., Henighan, T., and Olah, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.215418Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:d5ed09310f6b0943c9d1129f107ca5ee8681d80ae31da9835839d7001be55009","observation_id":"538642cd-e89d-4373-82b3-8385d2300887","resolution":{"observed_at":"2026-08-07T23:08:02.215418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.219881Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.219881Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:36e64ce9f0fc57ebf82703bf293035ee1f9acd5e3a11edfa03151bf150540a90","observation_id":"7587eac8-b019-45c7-8adf-5c40a3c9eafd","resolution":{"observed_at":"2026-08-07T23:08:02.219881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.293333Z","title":"A., Jagielski, M., Gao, I., Koh, P","venue":null,"work_id":"fd5b84d6-dbd1-4df0-b335-851c951b1eef","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.225773Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:d17147ce35a8341b6d69adf7ed78c56aaef81380f648b71b126d0b6fa659944e","observation_id":"7ff6efc6-042c-4596-9565-be56fa075660","resolution":{"observed_at":"2026-08-07T23:08:03.298174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T23:08:02.230810Z","title":"J., and Wong, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.230810Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:6a8f301c3a498d0fa3f00e67122028de06979759e9170050f013d428c781b4e1","observation_id":"a3e3daaf-7914-43bb-833d-200f1a153255","resolution":{"observed_at":"2026-08-07T23:08:02.230810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T23:08:02.235641Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.235641Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:27f65d49b63c11462df243bc1cc2433d7432199c7764de8af8227a0f798df7aa","observation_id":"4fe9b0f2-95fa-46b2-9c3c-c021d0c8a076","resolution":{"observed_at":"2026-08-07T23:08:02.235641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-07T23:08:02.240706Z","title":"Or-bench: An over-refusal benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.240706Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:bca9943a5e121ea654ba31dcc1334a370748acfccb0a4318ee919ba4779a8e6b","observation_id":"9b20750b-9e2c-47e2-ad85-3430e0d371e9","resolution":{"observed_at":"2026-08-07T23:08:02.240706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08268","last_updated":"2024-04-07T03:04:10Z","snapshot_observed_at":"2026-07-06T16:47:24.765597Z","submitted_at":"2023-11-14T16:02:16Z","title":"A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08268","snapshot_observed_at":"2026-08-07T23:08:02.245664Z","title":"A wolf in sheep's clothing: Generalized nested jailbreak prompts can fool large language models easily","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.245664Z"},"links":{"cited_paper":"/paper/2311.08268","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:c98e1f986a62e69a2ca4984fe4d4cd07e7402ebb674aea1b0227616b09c0530d","observation_id":"42e0e3a3-3aa5-415e-bf3e-68a6fcb04ac2","resolution":{"observed_at":"2026-08-07T23:08:02.245664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T23:08:02.250294Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.250294Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:32a193e36f6b541c995d0e2dde293c6dfcf49149a61e1520eaa9ffd11e2b4015","observation_id":"82608076-ae80-4037-8042-964c5bed937a","resolution":{"observed_at":"2026-08-07T23:08:02.250294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14860","last_updated":"2025-02-27T03:03:59Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:59:04Z","title":"Not All Language Model Features Are One-Dimensionally Linear","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14860","snapshot_observed_at":"2026-08-07T23:08:02.254996Z","title":"J., Liao, I., Gurnee, W., and Tegmark, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.254996Z"},"links":{"cited_paper":"/paper/2405.14860","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:513934664f59757e006ad70776d986a26f07a4794e9f22d9c7a5c5751360fd8f","observation_id":"da61c799-cd6e-46da-bef2-457e7d73ce2e","resolution":{"observed_at":"2026-08-07T23:08:02.254996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-07T23:08:02.259789Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.259789Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:a2dd6933f1b3eaf28a0a687f84c73904ef91e1558cd879c441e61725ce08180e","observation_id":"3d9a90ac-738b-4e33-8fb4-b77772dd73cf","resolution":{"observed_at":"2026-08-07T23:08:02.259789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.264888Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.264888Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:e4a590ddd81b05cfb557392857b79a722d1a506d4eb3b121dce8e92f64db50a0","observation_id":"5082f84c-cc85-4ff2-9bfe-86d9e9a4b889","resolution":{"observed_at":"2026-08-07T23:08:02.264888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T23:08:02.269258Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.269258Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:5eaaaf21ede65567d589a6facf3f4bc98806831c43b2d04f78432db14ee3307c","observation_id":"23ca78a9-997c-4099-b4ae-02e4c3ff15ca","resolution":{"observed_at":"2026-08-07T23:08:02.269258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10264","last_updated":"2024-08-21T15:12:37Z","snapshot_observed_at":"2026-08-06T20:21:15.838210Z","submitted_at":"2024-07-14T16:12:57Z","title":"What Makes and Breaks Safety Fine-tuning? A Mechanistic Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10264","snapshot_observed_at":"2026-08-07T23:08:02.274152Z","title":"S., Oksuz, K., Joy, T., Torr, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.274152Z"},"links":{"cited_paper":"/paper/2407.10264","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:b0f8fac0cfab375d59dfd12d0cd14177306d4da742ef648293735f135a612566","observation_id":"6b9a9920-c739-4a89-8c69-f234c6012681","resolution":{"observed_at":"2026-08-07T23:08:02.274152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.235966Z","title":"Artprompt: Ascii art-based jailbreak attacks against aligned llms","venue":null,"work_id":"e9fca5bd-5db1-40d6-a8ca-5442e49efba2","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.279049Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:6e090810645809526460091ef9d49ba321deba6a72dd938340d3e056cc3d6673","observation_id":"ae28165e-f542-45d2-89f6-304d6ab43b01","resolution":{"observed_at":"2026-08-07T23:08:03.251840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14744","last_updated":"2025-06-23T06:11:32Z","snapshot_observed_at":"2026-08-07T18:01:22.772663Z","submitted_at":"2025-02-20T17:14:34Z","title":"HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14744","snapshot_observed_at":"2026-08-07T23:08:02.283463Z","title":"Hiddendetect: Detecting jailbreak attacks against large vision-language models via monitoring hidden states","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.283463Z"},"links":{"cited_paper":"/paper/2502.14744","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:94c73c0be38def49ea30335b9d9550df415ac1f98f63fb651d8618fdefa30f39","observation_id":"d041aa4a-cf62-4cd8-a29d-8289e8798809","resolution":{"observed_at":"2026-08-07T23:08:02.283463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.288290Z","title":"and Moeller, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.288290Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:cae461301968c9045d31b0b5b4cb353efd1390322a667b8786b7c6edf3b55388","observation_id":"79e45a7e-76cf-463a-ba7d-93d8e5d1f7e3","resolution":{"observed_at":"2026-08-07T23:08:02.288290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-07T23:08:02.292674Z","title":"K., and Mihalcea, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.292674Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:05e090e71d83797a4ae360fa79388ab8e1310cbbd025176a0878fdb5a4202fb2","observation_id":"7646f38f-246d-4cbe-8366-4d53756e1f44","resolution":{"observed_at":"2026-08-07T23:08:02.292674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.210962Z","title":"Inference-time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":"b8be1c97-1d5c-4daa-b5cc-db5511dc2bde","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.297629Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:14d5a0ba2ea43cb353c6ed59a3242bc0e9649c5091134769b05a87af763f4394","observation_id":"348a6b4f-c389-49e8-bae9-04b0b7cfce4b","resolution":{"observed_at":"2026-08-07T23:08:03.216380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17003","last_updated":"2025-04-07T07:23:33Z","snapshot_observed_at":"2026-08-07T07:23:22.071348Z","submitted_at":"2024-08-30T04:35:59Z","title":"Safety Layers in Aligned Large Language Models: The Key to LLM Security","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17003","snapshot_observed_at":"2026-08-07T23:08:02.302336Z","title":"Safety layers in aligned large language models: The key to llm security","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.302336Z"},"links":{"cited_paper":"/paper/2408.17003","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:5d3198ec730ef5d75b5962a4cabb717b6f94c3e8731b94589250e0720dd1852a","observation_id":"9a175d9f-deb9-4e8c-8ceb-07f6bee309d0","resolution":{"observed_at":"2026-08-07T23:08:02.302336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-07T23:08:02.307047Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.307047Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:372fe6e4c0221e61646e9e28887cc49405720f3d9e131398b7a91d69ce4701ad","observation_id":"92e54623-1853-48b9-b9eb-63bc7ac3864a","resolution":{"observed_at":"2026-08-07T23:08:02.307047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16717","last_updated":"2024-02-26T16:35:59Z","snapshot_observed_at":"2026-07-06T17:35:36.900600Z","submitted_at":"2024-02-26T16:35:59Z","title":"CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16717","snapshot_observed_at":"2026-08-07T23:08:02.311644Z","title":"Codechameleon: Personalized encryption framework for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.311644Z"},"links":{"cited_paper":"/paper/2402.16717","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:402c21e6802b1ab7486d2fd1611cb5e5c44d2fbf86414cacad1bdb7aa132b5ee","observation_id":"1f6119c0-1d99-4d2a-98ad-af587fc43ac6","resolution":{"observed_at":"2026-08-07T23:08:02.311644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.192844Z","title":"Latent space translation via semantic alignment","venue":null,"work_id":"14ad13f5-f014-459c-9476-d09d44427f6d","year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.316472Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:d8f70278a1d79c1fe6e272113cfa5f3644f64e36dc3198ec6f27a6aa2fb819ef","observation_id":"2a97a2c1-4831-4e8f-8023-7d664b488f88","resolution":{"observed_at":"2026-08-07T23:08:03.199745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-07T23:08:02.320868Z","title":"Tree of attacks: Jailbreaking black-box llms automatically","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.320868Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:bc10816a4e07c4b944bff93722478d41fcd13671e3157388b70b26dd8afc1814","observation_id":"5cab35a3-1d74-436a-89d8-f36345162ce0","resolution":{"observed_at":"2026-08-07T23:08:02.320868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.325772Z","title":"Tree of attacks: Jailbreaking black-box llms automatically","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.325772Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:aaa0fb7cd4a7068e399c6ddf9616443a10d4de85610c68d115738851b71764d9","observation_id":"19e786ec-6733-49a6-be99-61c98ac31902","resolution":{"observed_at":"2026-08-07T23:08:02.325772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.165410Z","title":"Introducing the world's best edge models","venue":null,"work_id":"61b1c5fe-5786-4380-8fd1-06743e1c5eb7","year":null},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.329996Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:0351a5fe11ca2b41be872f64da2566590a1e7fa16e36121574f02ea5cbdfcc12","observation_id":"064659f7-bb0b-408b-9e84-4ff66ae2cf6e","resolution":{"observed_at":"2026-08-07T23:08:03.170884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.145262Z","title":"Interpreting gpt: The logit lens","venue":null,"work_id":"10dfbe0c-7d39-4a4d-8b2f-3509deb42068","year":2020},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.334399Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:81f6ade9bf31e6c204659879991f04ef973d790517d3c4f80308902dadef63c8","observation_id":"7c76989d-7e2f-45e5-8883-e1d923dfd6fd","resolution":{"observed_at":"2026-08-07T23:08:03.154811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.339096Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.339096Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:76b90f6b7b7af39e5cb7e6af097e0837a28060e1d2793f6d37d051f33aa6ca8e","observation_id":"b99e435c-d37b-4686-b7bd-a8e81b859708","resolution":{"observed_at":"2026-08-07T23:08:02.339096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03658","last_updated":"2024-07-17T22:24:27Z","snapshot_observed_at":"2026-07-06T16:43:58.947915Z","submitted_at":"2023-11-07T01:59:11Z","title":"The Linear Representation Hypothesis and the Geometry of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03658","snapshot_observed_at":"2026-08-07T23:08:02.343341Z","title":"J., and Veitch, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.343341Z"},"links":{"cited_paper":"/paper/2311.03658","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:5de0e0f9f00592e16f62344cb536c4ef7e330d870d777ba4ebc073e728eabb31","observation_id":"b2dc371c-e6eb-4442-9208-e6935ee776fb","resolution":{"observed_at":"2026-08-07T23:08:02.343341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04925","last_updated":"2024-04-07T11:52:44Z","snapshot_observed_at":"2026-08-09T02:23:58.261214Z","submitted_at":"2024-04-07T11:52:44Z","title":"Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04925","snapshot_observed_at":"2026-08-07T23:08:02.347819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.347819Z"},"links":{"cited_paper":"/paper/2404.04925","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:d4c8ecd5715c775bd13307102a4f074a9897ba70060b5c475c2ea2e44d729ce7","observation_id":"242608d1-ef0b-419a-a143-43eac70ff1bc","resolution":{"observed_at":"2026-08-07T23:08:02.347819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.352361Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.352361Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:a391a205a963ae33ae45e1cdd073fc0fd3f440a5640d218ea3ec206b54523db6","observation_id":"a5d77954-225c-4b4d-b47a-08898a04088a","resolution":{"observed_at":"2026-08-07T23:08:02.352361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.109277Z","title":"A strongreject for empty jailbreaks, 2024","venue":null,"work_id":"775288ad-a9de-4361-ab0f-e58898ffffeb","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.356677Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:06a1b3a56f657ae1aea7b88ecca2771a974260a4f6a834954d2c33b3276597d1","observation_id":"af117371-113a-4dbd-b623-17812b0a1182","resolution":{"observed_at":"2026-08-07T23:08:03.114182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01420","last_updated":"2024-08-02T17:55:50Z","snapshot_observed_at":"2026-08-05T10:39:26.760383Z","submitted_at":"2024-08-02T17:55:50Z","title":"Mission Impossible: A Statistical Perspective on Jailbreaking LLMs","version":1},"cited_work":{"arxiv_id":"2408.01420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01420","snapshot_observed_at":"2026-08-07T23:08:02.700239Z","title":"Mission Impossible: A Statistical Perspective on Jailbreaking LLMs","venue":"cs.LG","work_id":"a7f58ace-c3ec-4d95-a683-203a2057c06f","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.360944Z"},"links":{"cited_paper":"/paper/2408.01420","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:a78681e1ba98bd959a2bb125206ec500efc3c5c67da7c18a4bfea80e2164fdf1","observation_id":"8462c8aa-9c0b-4ab3-8872-8cd0db12909b","resolution":{"observed_at":"2026-08-07T23:08:02.707111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.365325Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.365325Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:7c662a5c077f8435f1b663c63e41288132c82a71fbd562987887ae5c7c0d78ac","observation_id":"a4d21228-1af9-4c6f-b676-051099dda54b","resolution":{"observed_at":"2026-08-07T23:08:02.365325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11857","last_updated":"2024-08-15T20:17:33Z","snapshot_observed_at":"2026-07-06T19:04:13.760549Z","submitted_at":"2024-08-15T20:17:33Z","title":"Hermes 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11857","snapshot_observed_at":"2026-08-07T23:08:02.369692Z","title":"Hermes 3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.369692Z"},"links":{"cited_paper":"/paper/2408.11857","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:066f46846cc60bd5e4df9d7185105afc6aab96b9f0d6e248c4c2d86d70977046","observation_id":"320e0a42-2383-4b22-ace2-29f7b06777cb","resolution":{"observed_at":"2026-08-07T23:08:02.369692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.083501Z","title":"Detox: Toxic subspace projection for model editing","venue":null,"work_id":"5b5df683-1d10-42e1-88ec-8aff8c6b6a02","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.374485Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:eb5a466f629608fae2c392055d92836dc89ab591d872cd2f8af8acfc19c215cd","observation_id":"59c5667f-71a5-480b-8dee-e1ba52d91567","resolution":{"observed_at":"2026-08-07T23:08:03.088650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05162","last_updated":"2024-10-24T19:21:52Z","snapshot_observed_at":"2026-08-02T21:32:36.729604Z","submitted_at":"2024-02-07T18:34:38Z","title":"Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05162","snapshot_observed_at":"2026-08-07T23:08:02.378812Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.378812Z"},"links":{"cited_paper":"/paper/2402.05162","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:fa468d2e07274649826e180827b2cc5ca4c4caf0b08cd4540d9fabc35e2d1713","observation_id":"737f3945-a6cc-4a1f-b817-56b3c983d795","resolution":{"observed_at":"2026-08-07T23:08:02.378812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:02.383256Z","title":"a ger, T., Elstner, J., Geisler, S., Cohen-Addad, V., G \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.383256Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:c542458c5d58368f9e71a1828e22eec05bf1c04504f334593ec15877364d6132","observation_id":"8b894c94-9f12-4f6c-b447-82eaea163ff6","resolution":{"observed_at":"2026-08-07T23:08:02.383256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-07T23:08:02.387653Z","title":"Y., and Poovendran, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.387653Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:a6f5579a732b1ab327499dccb29042de9750bde1beaab41b61befb21619dfd3e","observation_id":"434dbf62-dba0-407d-a3db-c61502453e29","resolution":{"observed_at":"2026-08-07T23:08:02.387653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.068005Z","title":"Beyond toxic neurons: A mechanistic analysis of dpo for toxicity reduction","venue":null,"work_id":"b57ce634-dcb7-4679-be77-d3f3951c6695","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.392401Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:09acd126803d2e20d7e6646150eaec704e3473fe641a00953c39d0c6b18f4732","observation_id":"921adb6e-823d-4c74-8b2d-93922965bd24","resolution":{"observed_at":"2026-08-07T23:08:03.073111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09055","last_updated":"2024-05-15T03:04:05Z","snapshot_observed_at":"2026-08-08T01:16:46.951022Z","submitted_at":"2024-05-15T03:04:05Z","title":"A safety realignment framework via subspace-oriented model fusion for large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09055","snapshot_observed_at":"2026-08-07T23:08:02.396873Z","title":"A safety realignment framework via subspace-oriented model fusion for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.396873Z"},"links":{"cited_paper":"/paper/2405.09055","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:056f6814a946921e723fcaf43dcdf430b9870f1382ee3e0a36760e2382c5f401","observation_id":"18e6a65f-3ff8-458c-a9f6-fd034c45081d","resolution":{"observed_at":"2026-08-07T23:08:02.396873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-07T23:08:02.401728Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.401728Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:0c0bda7b423eee60c51f52a9bdbe2265a740d91636f46752e1e3a06741f70755","observation_id":"ebe7a971-d1ae-4437-b7b3-138e698230a1","resolution":{"observed_at":"2026-08-07T23:08:02.401728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-07T23:08:02.406517Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.406517Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:86375096b36ab29a8d67d39d29df88bdc4c4a43a2ad1af04b735cda6689c60b0","observation_id":"9e620374-a280-466a-895f-1e0c9b06836a","resolution":{"observed_at":"2026-08-07T23:08:02.406517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T23:08:02.411449Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.411449Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:3b0d47ad4329be8fccaf07f8151f422b72fefbaf7cf3df3bbb38ec445bb25c90","observation_id":"d896d403-2005-443e-9c5b-fa6408a31bde","resolution":{"observed_at":"2026-08-07T23:08:02.411449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:08:03.050919Z","title":"How alignment and jailbreak work: Explain llm safety through intermediate hidden states","venue":null,"work_id":"559fe2f9-ee9a-4a40-82cb-d02ebce9c0a4","year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.416060Z"},"links":{"citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:8db447e09e3ab35758d384116bb04a12045caf740774fd298e26f98f0d0f0547","observation_id":"621f29b2-202f-4cd2-829c-3e80ce477a10","resolution":{"observed_at":"2026-08-07T23:08:03.057177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13708","last_updated":"2025-02-24T13:31:08Z","snapshot_observed_at":"2026-07-06T19:35:26.421419Z","submitted_at":"2024-10-17T16:08:06Z","title":"On the Role of Attention Heads in Large Language Model Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13708","snapshot_observed_at":"2026-08-07T23:08:02.421540Z","title":"On the role of attention heads in large language model safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.421540Z"},"links":{"cited_paper":"/paper/2410.13708","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:fe50bd7ca173c8a609cab0f5d0a78ce7c985ae599ceea90b5093c63e2fe45c72","observation_id":"36b35852-d14a-4f02-82c6-ac02953c7d69","resolution":{"observed_at":"2026-08-07T23:08:02.421540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T23:08:02.426832Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.426832Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:ac20335b436959273cd64a407353c3544a33c83d400e0645310af2f3c46c9204","observation_id":"2f5f7fef-e0d1-41c1-8fba-b0f34a872051","resolution":{"observed_at":"2026-08-07T23:08:02.426832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 14 inbound Pith citation observations for arXiv:2502.09674."}