{"as_of":"2026-08-10T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32330346bb690151baefca16b541771b1ef72edd0dc473a117bdb04e6e9bae6e","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:01:47.854894Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:09:32.736304Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T21:38:00.071469Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"cited_work":{"arxiv_id":"2507.21141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21141","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wollschl¨ager, T., Elstner, J., Geisler, S., Cohen-Addad, V ., G¨unnemann, S., and Gasteiger, J","venue":null,"work_id":"4664fb57-1d86-45f7-8703-349846c87701","year":null},"citing_paper":{"arxiv_id":"2605.12726","last_updated":"2026-07-09T09:24:42Z","snapshot_observed_at":"2026-08-06T13:20:37.791677Z","submitted_at":"2026-05-12T20:30:24Z","title":"Before the Last Token: Diagnosing Final-Token Safety Probe Failures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:37:02.439454Z"},"links":{"cited_paper":"/paper/2507.21141","citing_paper":"/paper/2605.12726"},"observation_digest":"sha256:616ce3b674eb9245bad694ba4fa8b37fa8655576021d022901bd8179a93ca527","observation_id":"05b043eb-10a1-4ebf-9169-085a654c8545","resolution":{"observed_at":"2026-05-14T21:38:00.073909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21141","snapshot_observed_at":"2026-08-02T07:09:32.736304Z","title":"Alexandra Souly, Qingyuan Lu, Dillon Bowen, Tu Trinh, Elvis Hsieh, Sana Pandey, Pieter Abbeel, Justin Sveg- liato, Scott Emmons, Olivia Watkins, and Sam Toyer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13075","last_updated":"2026-07-12T20:37:19Z","snapshot_observed_at":"2026-08-09T10:59:34.877020Z","submitted_at":"2026-07-12T20:37:19Z","title":"The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:09:32.736304Z"},"links":{"cited_paper":"/paper/2507.21141","citing_paper":"/paper/2607.13075"},"observation_digest":"sha256:0b74d7434f225e9de5d306c96c9c5206e2eb76da8959dba13874b046a6525d04","observation_id":"28a2ee74-b0c1-4dc9-a21e-8d16199d1ba7","resolution":{"observed_at":"2026-08-02T07:09:32.736304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21141/citation-record","integrity":"/paper/2507.21141/integrity","json":"/paper/2507.21141/citation-record.json","paper":"/paper/2507.21141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T15:01:47.765176Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.765176Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:69c69526aef5857d4f6b785a57aff19bac7d2638a51770e0412e14b0ecddc0fc","observation_id":"ecb6aa75-1eaf-4e6c-89a3-701ad29a7dff","resolution":{"observed_at":"2026-08-06T15:01:47.765176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10014","last_updated":"2024-10-13T21:24:25Z","snapshot_observed_at":"2026-08-09T11:38:40.999049Z","submitted_at":"2024-10-13T21:24:25Z","title":"Safety-Aware Fine-Tuning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10014","snapshot_observed_at":"2026-08-06T15:01:47.772974Z","title":"Safety-aware fine-tuning of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.772974Z"},"links":{"cited_paper":"/paper/2410.10014","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:df8b61f0d6390e4a2b2f80f6662afd30443c5aedea46541fdcef676f28770310","observation_id":"82c5c459-c5e7-4430-96b4-4da7071c1999","resolution":{"observed_at":"2026-08-06T15:01:47.772974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T15:01:47.776571Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.776571Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:e19ce820df6ade02d9a4ff0235a435ca44fadd43472aa16c90c9de284e089787","observation_id":"f360be14-326c-43cc-8947-f019ae1cba39","resolution":{"observed_at":"2026-08-06T15:01:47.776571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:01:47.791537Z","title":"Maria Halkidi, Yannis Batistakis, and Michalis Vazirgiannis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.791537Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:ac78b0d5b1feb4fa385eff7b2fac79cbbc2167f4e72b48aac4cb57b7aade3653","observation_id":"7fb6beaf-c30a-4a6e-a4a4-0d5bf79bceec","resolution":{"observed_at":"2026-08-06T15:01:47.791537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.801834Z","title":"Safedpo: A simple approach to direct preference optimization with enhanced safety","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.801834Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:3848713eb6ff011758f177689fcb2f26b2e352e4a8dfc672ced2a98103ed019d","observation_id":"a528a80c-c0b7-4f4d-9440-a7b03bb7d901","resolution":{"observed_at":"2026-08-06T15:01:47.801834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-06T15:01:47.805088Z","title":"Xiaogeng Liu, Nan Xu, Muhao Chen, and Chaowei Xiao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.805088Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:946198709369571ed2cc944548fa8f0d4362c934eb8123fc008499fec07165ff","observation_id":"6b0343f1-d2dc-41e9-9564-a4d601b82724","resolution":{"observed_at":"2026-08-06T15:01:47.805088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-08-08T15:03:18.474377Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-06T15:01:47.808584Z","title":"Enhancing llm safety via constrained direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.808584Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:8fa11fe1ab21b1e43eb771235f33f74dc234deb38bf2e528b5bde5da48f93c33","observation_id":"a1939382-08e1-4005-bcf6-ae0c11ce47c8","resolution":{"observed_at":"2026-08-06T15:01:47.808584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-06T15:01:47.812006Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.812006Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:c54a767b00d69edc6956336ec3e8f67c3cdd1f08ec7cec566ade35848eb772c2","observation_id":"ff0ef252-7b16-4373-8618-3decc99bb851","resolution":{"observed_at":"2026-08-06T15:01:47.812006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-06T15:01:47.815767Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.815767Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:1cc5f589240822cad4d1584d1e0f1bc0479caa7d00fd92778abcf887decf736d","observation_id":"a681fd9b-fb00-472c-b52d-078489649203","resolution":{"observed_at":"2026-08-06T15:01:47.815767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00941","last_updated":"2023-09-07T20:36:48Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T13:37:34Z","title":"Emergent Linear Representations in World Models of Self-Supervised Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00941","snapshot_observed_at":"2026-08-06T15:01:47.819681Z","title":"Emergent linear representations in world models of self-supervised sequence models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.819681Z"},"links":{"cited_paper":"/paper/2309.00941","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:4678366ef803035dce5db301a97b49268d3496424ed492b3612dc3701bd2211b","observation_id":"509a0729-c1e0-46ab-a923-9a4e81bc055d","resolution":{"observed_at":"2026-08-06T15:01:47.819681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-09T02:24:15.276351Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09674","snapshot_observed_at":"2026-08-06T15:01:47.822986Z","title":"The hidden dimensions of llm alignment: A multi-dimensional safety analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.822986Z"},"links":{"cited_paper":"/paper/2502.09674","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:708ad82e3a261395768d4c44a50b414dd9ff723a5f60d744f2b2a7b962660fcf","observation_id":"70ffcc5d-2c1c-4592-ac8a-bbbb34600921","resolution":{"observed_at":"2026-08-06T15:01:47.822986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.204642Z","title":"Interpretable steering of large language models with feature guided activation additions","venue":null,"work_id":"a6f66b46-f717-4c36-ac86-7569f9eb1c44","year":2025},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.826803Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:cf6580581094dda76943a6df2660fffd987bd2489387e3cdb22b73c42a2f512f","observation_id":"0a8fb2e9-746c-4bd9-808e-5dc127b0f233","resolution":{"observed_at":"2026-08-06T15:01:48.208051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-08-08T01:44:57.952179Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-06T15:01:47.830115Z","title":"Linear representa- tions of sentiment in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.830115Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:7e11157722684c7c0ac8cabe841e65aa28ef533f56cf5cf8678d308b53633e6b","observation_id":"a850eefb-8758-4c6a-934d-26aa0304363f","resolution":{"observed_at":"2026-08-06T15:01:47.830115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T15:01:47.833410Z","title":"Tom Wollschl ¨ager, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan G ¨unnemann, and Johannes Gasteiger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.833410Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:f3243f4789021d94aaaa139e47d1d8fcddf5f19fb380f1615416fc24cb1ebf0e","observation_id":"4ad54f81-b217-4a3e-b17c-67d477fd1619","resolution":{"observed_at":"2026-08-06T15:01:47.833410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.195614Z","title":"pyvene: A library for understanding and improving PyTorch models via interventions","venue":null,"work_id":"29058b96-68e3-41ac-b4fa-fa2574a71160","year":2024},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.836938Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:acb16854bb1d120c698982390a9fc5c85a6a322a6787a8e6a5346bdda4e960c7","observation_id":"47b0c430-ee7b-49a7-acd6-18f093ce0bce","resolution":{"observed_at":"2026-08-06T15:01:48.198757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.185092Z","title":"URL https://aclanthology.org/2024.naacl-demo","venue":null,"work_id":"db6b1f3b-774b-415e-8705-c18d37d96b0e","year":2024},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.840771Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:c4371deb671ec2d37b7e423513b1682cf65613eff4ea49e9f8f5ed27b19c2725","observation_id":"3407a27e-cdb7-4591-9266-9b563e4e3180","resolution":{"observed_at":"2026-08-06T15:01:48.189182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T15:01:47.843887Z","title":"Yuanshun Yao, Xiaojun Xu, and Yang Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.843887Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:19e4fed96ec0f05de5ac58ed81273a773c69f6755c032c79312dc9665867d6a0","observation_id":"ea24d6d9-d573-408f-b00e-5409aa37c140","resolution":{"observed_at":"2026-08-06T15:01:47.843887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21800","last_updated":"2025-05-27T22:14:54Z","snapshot_observed_at":"2026-08-09T06:24:17.797085Z","submitted_at":"2025-05-27T22:14:54Z","title":"From Directions to Cones: Exploring Multidimensional Representations of Propositional Facts in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21800","snapshot_observed_at":"2026-08-06T15:01:47.847228Z","title":"From directions to cones: Exploring multidimensional representations of propositional facts in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.847228Z"},"links":{"cited_paper":"/paper/2505.21800","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:e6b91cd44fe287b826e68bee0a097f175fe0b625728fa59277db3acab90f144a","observation_id":"f5c4d94f-9caa-4c5e-8b5b-e722938ad976","resolution":{"observed_at":"2026-08-06T15:01:47.847228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.174852Z","title":"Under review","venue":null,"work_id":"d8e7b38b-2826-4aab-81ec-65e910b38544","year":2002},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.850568Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:f47c056df9fc89101d5ced968f59b620db8604fd8cc030a04ea7609337211843","observation_id":"e59f07d6-563b-4f03-b42d-8bf5f66c7b67","resolution":{"observed_at":"2026-08-06T15:01:48.177822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.163046Z","title":null,"venue":null,"work_id":"79cf1f7e-37d1-4c26-a6d1-2b341516a387","year":2024},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.854894Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:cb2114bad35f9f847d1bbcc5c5b4bd5089667abf19f0e0e5bfaea3921fb6848d","observation_id":"323d869c-b384-4e58-b0b8-df3e41f18161","resolution":{"observed_at":"2026-08-06T15:01:48.167501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.769206Z","title":"doi: https:// doi.org/10.1016/S0031-3203(96)00142-2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.769206Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:69714605b28293cef78e428d495f722edcff18cec8ae84d02f208f427cec3156","observation_id":"4a5a077b-c308-4fea-820a-662d0f93c565","resolution":{"observed_at":"2026-08-06T15:01:47.769206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08145","last_updated":"2025-01-14T14:23:18Z","snapshot_observed_at":"2026-08-05T16:43:12.384747Z","submitted_at":"2025-01-14T14:23:18Z","title":"Refusal Behavior in Large Language Models: A Nonlinear Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08145","snapshot_observed_at":"2026-08-06T15:01:47.794774Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.794774Z"},"links":{"cited_paper":"/paper/2501.08145","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:e87f3f63e80bcc5dbd12d201cd5a81ffa1b9b44ec669f1b66a1b94eb66d78cfc","observation_id":"580723f0-2f20-47b0-897a-9660e8d9a8e0","resolution":{"observed_at":"2026-08-06T15:01:47.794774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.787746Z","title":"emnlp-main.273","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.787746Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:140a369253c7be536ac82f8b93c5871fe9d19dda9fc197afd9e3c820b455060b","observation_id":"15050118-aeec-4901-9351-987148f61d04","resolution":{"observed_at":"2026-08-06T15:01:47.787746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-06T15:01:47.780339Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.780339Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:713f55c1c7484a925d7a0425e2eebd3d5dec2452defcee4e39e15965a7058649","observation_id":"2ad56729-0f6b-43cc-88de-f5f7a594dbb2","resolution":{"observed_at":"2026-08-06T15:01:47.780339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:48.214834Z","title":null,"venue":null,"work_id":"cf6fed15-ae99-41e3-b67b-08005828142c","year":2020},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.784263Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:ca1a139288edb3a2b2a36266ebd692056fc8cc49d95eb07acbccd93a4aade9a9","observation_id":"266f749f-500e-42c1-9e67-1ad2a6323e5f","resolution":{"observed_at":"2026-08-06T15:01:48.218134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-06T15:01:47.757141Z","title":"anthropic.com/news/anthropics-responsible-scaling-policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.757141Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:cbf8ef96686ffe61fb7cde40cd1a7c2cccf5947b12ce154bf2aa66bc2e035246","observation_id":"2b54dfec-7589-47ba-96ab-80ad776a304e","resolution":{"observed_at":"2026-08-06T15:01:47.757141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:47.761453Z","title":"On the dangers of stochastic parrots: Can language models be too big? In Proceedings of the 2021 ACM conference on fairness, accountability, and transparency, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.761453Z"},"links":{"citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:fbd1453723ac28ee2b3a39ad360857cca0117dfb5fa7fc339d7f897e48468211","observation_id":"9ab45db4-4393-4a33-b972-58749b0b829a","resolution":{"observed_at":"2026-08-06T15:01:47.761453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03867","last_updated":"2024-03-06T17:17:36Z","snapshot_observed_at":"2026-08-04T18:22:42.733859Z","submitted_at":"2024-03-06T17:17:36Z","title":"On the Origins of Linear Representations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03867","snapshot_observed_at":"2026-08-06T15:01:47.798462Z","title":"On the origins of linear representations in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:47.798462Z"},"links":{"cited_paper":"/paper/2403.03867","citing_paper":"/paper/2507.21141"},"observation_digest":"sha256:b23f5ee1878f2c2b085b4da6f449f9cd9f5a044af43db70d557be517cb40f206","observation_id":"89355c50-affb-4354-b6b5-88a10c87a02d","resolution":{"observed_at":"2026-08-06T15:01:47.798462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21141","last_updated":"2025-07-23T07:56:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T17:13:01.062803Z","submitted_at":"2025-07-23T07:56:05Z","title":"The Geometry of Harmfulness in LLMs through Subconcept Probing"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 2 inbound Pith citation observations for arXiv:2507.21141."}