{"as_of":"2026-08-18T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f331b1d909bb74889ffbc4f6adbcea81ee4629f3615527815753353a87cd3188","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:35:04.619230Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-10T19:34:26.909588Z","title":"David Chanin, James Wilken-Smith, Tomáš Dulka, Hardik Bhatnagar, and Joseph Bloom","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09929","last_updated":"2025-04-02T13:20:40Z","snapshot_observed_at":"2026-08-17T17:34:05.054006Z","submitted_at":"2025-01-17T02:55:23Z","title":"Interpretable Steering of Large Language Models with Feature Guided Activation Additions","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T19:34:26.909588Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2501.09929"},"observation_digest":"sha256:7c94d0f3853f9847cd440f5e441f507db7ec74c02dc08e5bbe18d22a26a8d41b","observation_id":"d87ac576-f7f9-4db6-9b55-bd6313842b14","resolution":{"observed_at":"2026-08-10T19:34:26.909588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-09T10:11:51.456407Z","title":"Improving steering vectors by targeting sparse autoencoder features, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03032","last_updated":"2025-07-24T21:16:27Z","snapshot_observed_at":"2026-08-15T22:22:36.614106Z","submitted_at":"2025-02-05T09:39:34Z","title":"Analyze Feature Flow to Enhance Interpretation and Steering in Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T10:11:51.456407Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2502.03032"},"observation_digest":"sha256:2ec482e212d85eb538f6b94cf3b1ba02eb87a67c095a023fe8a63ed791870e88","observation_id":"8e0726db-180b-438b-a167-df0d0d9fc048","resolution":{"observed_at":"2026-08-09T10:11:51.456407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-16T11:35:04.619230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15133","last_updated":"2025-09-14T08:10:18Z","snapshot_observed_at":"2026-08-18T01:48:09.761501Z","submitted_at":"2025-04-21T14:33:55Z","title":"EasyEdit2: An Easy-to-use Steering Framework for Editing Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:35:04.619230Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2504.15133"},"observation_digest":"sha256:2c3b8ae459b9c98d8565f1cb231360f5d1aa11005ec6d65fb983093103184c82","observation_id":"db28d5ab-e1f6-455e-b915-4cf6bcdd1b09","resolution":{"observed_at":"2026-08-16T11:35:04.619230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-16T00:00:08.637537Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.03189","last_updated":"2025-05-06T05:15:12Z","snapshot_observed_at":"2026-08-18T08:39:27.182713Z","submitted_at":"2025-05-06T05:15:12Z","title":"Patterns and Mechanisms of Contrastive Activation Engineering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:00:08.637537Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2505.03189"},"observation_digest":"sha256:5700a07bd5c0ea3f0114218356ac26813ba459e00391198acacb38c9db2e3de7","observation_id":"997387e0-15fc-43cc-80c4-f72d534c6612","resolution":{"observed_at":"2026-08-16T00:00:08.637537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T15:01:47.266440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16612","last_updated":"2025-10-14T08:28:41Z","snapshot_observed_at":"2026-08-16T03:55:54.861868Z","submitted_at":"2025-05-22T12:47:16Z","title":"Steering Large Language Models for Machine Translation Personalization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:01:47.266440Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2505.16612"},"observation_digest":"sha256:a35bec9060887f6c2d68388bbe9020d9989125950b35c9592c3d67567626b065","observation_id":"3159d892-b602-495b-89bc-6bd7b45f991a","resolution":{"observed_at":"2026-08-07T15:01:47.266440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T14:02:59.154435Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-15T08:10:04.533805Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:59.154435Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:84774141875a15d1f4d894fe912c0d663d5f0b478d47836471ca9dcf4f7fb3aa","observation_id":"d04aa17b-e3fd-4de2-a6cf-85e93322aba3","resolution":{"observed_at":"2026-08-07T14:02:59.154435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T14:38:52.048185Z","title":"David Chanin, James Wilken-Smith, Tomás Dulka, Hardik Bhatnagar, and Joseph Bloom","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20322","last_updated":"2025-06-03T13:40:17Z","snapshot_observed_at":"2026-08-14T21:51:03.763855Z","submitted_at":"2025-05-23T17:59:18Z","title":"Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target Atoms","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:52.048185Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2505.20322"},"observation_digest":"sha256:136e9429c3804f1fe04e5b75dc68a1c466932bc94568a6caa8b3f386475b4e96","observation_id":"3d775816-7bcf-4e05-8ed6-7fdbe7c05813","resolution":{"observed_at":"2026-08-07T14:38:52.048185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T12:30:03.859840Z","title":"Im- proving Steering Vectors by Targeting Sparse Autoencoder Features, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24360","last_updated":"2025-07-10T23:59:56Z","snapshot_observed_at":"2026-08-09T07:02:16.860236Z","submitted_at":"2025-05-30T08:53:27Z","title":"Interpreting Large Text-to-Image Diffusion Models with Dictionary Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:03.859840Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2505.24360"},"observation_digest":"sha256:bd38b009566315339fe894210d6c3d7ba2826f771d30b5d896cd8d0665305386","observation_id":"b2788b2d-648a-43fe-ad66-258085818b62","resolution":{"observed_at":"2026-08-07T12:30:03.859840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-15T02:56:03.854072Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:1f812632c8ce7b48c96736c687deeaee73065d01d0441c4791b514140320c9bf","observation_id":"249a05ac-306b-4253-be12-a13783ea0df7","resolution":{"observed_at":"2026-05-19T11:37:16.005446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-07T10:24:26.327706Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05451","last_updated":"2025-06-05T17:56:05Z","snapshot_observed_at":"2026-08-15T21:12:10.172980Z","submitted_at":"2025-06-05T17:56:05Z","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:26.327706Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2506.05451"},"observation_digest":"sha256:6be5e91dad2d9a7b48be75e394dc936cb508b2603127e8541643945a194cd722","observation_id":"d8ea653f-a2ff-40a9-9f0f-2877412ba779","resolution":{"observed_at":"2026-08-07T10:24:26.327706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-08-11T07:06:38.718933Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:38ea0c756e21bb34f2af4a00f9786c9f1156a352781e958c71a9eb295b5efb47","observation_id":"5ecc1534-6c9f-49e4-81b8-68ce454375a6","resolution":{"observed_at":"2026-05-16T08:17:36.642532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2605.01844","last_updated":"2026-06-04T12:53:36Z","snapshot_observed_at":"2026-08-17T05:06:29.095007Z","submitted_at":"2026-05-03T12:26:13Z","title":"The Cylindrical Representation Hypothesis for Language Model Steering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T00:10:29.122196Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2605.01844"},"observation_digest":"sha256:3188bb115b6bfda01d05903210df98a4ec7e7de363453c3207635490f69da480","observation_id":"efe046f6-92c2-46b7-9b2f-cee2a16178d3","resolution":{"observed_at":"2026-07-01T00:15:09.223743Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2605.12671","last_updated":"2026-05-12T19:21:23Z","snapshot_observed_at":"2026-08-02T21:44:59.407489Z","submitted_at":"2026-05-12T19:21:23Z","title":"All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-14T20:52:47.074893Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2605.12671"},"observation_digest":"sha256:51a7b8de26fa906cef45a22a6bcfe93e0f7ed36cd81fa5852be61bcef9b50fb0","observation_id":"65f92ce2-2593-4cf3-a524-e6b9fcbb500a","resolution":{"observed_at":"2026-05-14T20:52:57.527901Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2605.12813","last_updated":"2026-05-31T17:51:51Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:13:50Z","title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:10.814899Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2605.12813"},"observation_digest":"sha256:b0b9a48ab0502e982eb0464ef7cf48fd02d48f4fd958a46f2212caa2eaaa324a","observation_id":"f511845b-8969-4720-adb8-b16a3ba7c1c8","resolution":{"observed_at":"2026-05-14T20:17:56.346581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2605.23036","last_updated":"2026-05-21T21:00:32Z","snapshot_observed_at":"2026-08-18T16:15:31.295435Z","submitted_at":"2026-05-21T21:00:32Z","title":"Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T05:35:04.688774Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2605.23036"},"observation_digest":"sha256:5e2d719e08935ca0e89cba56b8d12e1e69a1c5c167817936b5cc3e8e15a5539b","observation_id":"d2d3e1cc-94f8-4272-aa30-04606ceac725","resolution":{"observed_at":"2026-05-25T05:36:39.360944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2605.23040","last_updated":"2026-05-21T21:13:14Z","snapshot_observed_at":"2026-08-02T04:36:31.374601Z","submitted_at":"2026-05-21T21:13:14Z","title":"Steered Generation via Gradient-Based Optimization on Sparse Query Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:31:29.510639Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2605.23040"},"observation_digest":"sha256:517a9da0fc81dd5e117183bf788a902bc6ad2b3b56318b0bcd6fb112e6f20c33","observation_id":"3bc28867-5b0b-4ff6-a2ce-5d611bb1657e","resolution":{"observed_at":"2026-05-25T05:36:40.347296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2605.28664","last_updated":"2026-05-27T15:59:45Z","snapshot_observed_at":"2026-08-14T06:30:00.621358Z","submitted_at":"2026-05-27T15:59:45Z","title":"Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:53:27.306664Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2605.28664"},"observation_digest":"sha256:992e11328b37be37a2a6f39c67612796fc622f6a608a98fdc24b885974550498","observation_id":"ed9e2903-39d0-4779-bc04-32b6c2fb40e4","resolution":{"observed_at":"2026-06-29T14:03:29.915587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2605.28669","last_updated":"2026-05-27T16:04:35Z","snapshot_observed_at":"2026-08-14T12:42:05.785008Z","submitted_at":"2026-05-27T16:04:35Z","title":"Sense Representations Are Inducible Interfaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T12:35:57.341052Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2605.28669"},"observation_digest":"sha256:bf242cbe08015fe8626ab9848c77e10a61e4bc14ecb8fde680864bdae8a81859","observation_id":"492e8566-3c24-4653-9b73-e8ab6757d336","resolution":{"observed_at":"2026-06-29T12:43:25.927568Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2606.03002","last_updated":"2026-06-04T19:39:22Z","snapshot_observed_at":"2026-08-16T01:59:20.179381Z","submitted_at":"2026-06-02T01:17:05Z","title":"Perplexity Can Miss SAE Feature Damage Under Quantization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T11:41:18.460538Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2606.03002"},"observation_digest":"sha256:361e0013776c979ff59d2153209fb31ce4cd9e74d44efeb2420d421ea74d1f29","observation_id":"e7aa1c0c-293d-4012-957d-9cecb84c59f7","resolution":{"observed_at":"2026-07-02T01:36:25.775517Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":"2411.02193","doi":"10.48550/arxiv.2411.02193","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193","venue":"arXiv (Cornell University)","work_id":"a13a989e-ea2e-4d17-b6be-0378be042e41","year":2023},"citing_paper":{"arxiv_id":"2606.08496","last_updated":"2026-06-07T07:54:25Z","snapshot_observed_at":"2026-08-17T05:32:41.029384Z","submitted_at":"2026-06-07T07:54:25Z","title":"SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T18:35:47.513717Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2606.08496"},"observation_digest":"sha256:e954a2d37c454c74fd898b172f2da99c64b53b851f3e95b0d631d10eb02772e2","observation_id":"3caf54b0-a883-4c84-85a5-80e605dc1aeb","resolution":{"observed_at":"2026-07-02T22:57:25.979965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-02T05:16:33.834746Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.834746Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:6d80bdc5a6f0bbd8ef41739c91f13ef4fd74dffc10d96c97c35547ca56582aaf","observation_id":"57e5a1e5-e8bb-437e-9e79-25a1da05a53e","resolution":{"observed_at":"2026-08-02T05:16:33.834746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-02T12:14:22.541696Z","title":"arXiv preprint arXiv:2411.02193 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19364","last_updated":"2026-08-11T12:45:56Z","snapshot_observed_at":"2026-08-18T02:47:01.984498Z","submitted_at":"2026-06-05T19:27:31Z","title":"SAE-StatSteer: Statistical Consensus Feature Selection for Optimization-Free Activation Steering of Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T12:14:22.541696Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.19364"},"observation_digest":"sha256:ef57b01d6be7ea71aed0594a4afd0d512a40bac02fec71c928ce7d709a219cc1","observation_id":"e6ed6efa-fd40-47f7-9eb6-a9242dcde22b","resolution":{"observed_at":"2026-08-02T12:14:22.541696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-15T15:40:27.580176Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.580176Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:9266883b2940bc1c76ece314b350c0eed27680185539cc3080e8cec3097ef19b","observation_id":"f56b1e10-1f41-4f71-83e1-b1bb8170c523","resolution":{"observed_at":"2026-08-15T15:40:27.580176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-01T10:03:54.246937Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20596","last_updated":"2026-07-22T17:33:16Z","snapshot_observed_at":"2026-08-15T09:33:27.353760Z","submitted_at":"2026-07-22T17:33:16Z","title":"Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T10:03:54.246937Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.20596"},"observation_digest":"sha256:4aa6032cbe8e0163cd5df9caceee2f942a947ee3aaf55d564ad10ea9aff5a3c4","observation_id":"889572a1-6481-45a4-8454-7b08237fae3b","resolution":{"observed_at":"2026-08-01T10:03:54.246937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-01T09:29:08.246807Z","title":", Siu, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20778","last_updated":"2026-07-22T23:00:02Z","snapshot_observed_at":"2026-08-12T19:36:34.237255Z","submitted_at":"2026-07-22T23:00:02Z","title":"Toward Mechanistic Interpretability of an AI Foundation Model Fine-Tuned for Atmospheric Chemistry","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T09:29:08.246807Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.20778"},"observation_digest":"sha256:62f5717c70bddf2bd390ba71a47d6b192e333bc8b07ff86ce17184046eccb849","observation_id":"c4d31c6b-6113-4383-8ef4-9414b4106360","resolution":{"observed_at":"2026-08-01T09:29:08.246807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-01T03:00:44.857125Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25270","last_updated":"2026-07-28T04:18:24Z","snapshot_observed_at":"2026-08-15T23:21:54.142838Z","submitted_at":"2026-07-28T04:18:24Z","title":"Where Steering Signals Come From: Activation Source Selection in Activation Steering","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T03:00:44.857125Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.25270"},"observation_digest":"sha256:d3b6a5bde821a5604e9e784d9a32512602818015cb0d2694f00c58de76ff1c86","observation_id":"e5ddab83-8554-4767-b1f0-ac42b38d2f86","resolution":{"observed_at":"2026-08-01T03:00:44.857125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-06T13:56:22.619018Z","title":"arXiv preprint arXiv:2411.02193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04904","last_updated":"2026-08-06T04:47:27Z","snapshot_observed_at":"2026-08-18T19:39:39.291438Z","submitted_at":"2026-08-05T14:32:14Z","title":"Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T13:56:22.619018Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2608.04904"},"observation_digest":"sha256:d8f5cf2d572a0d831b80ebcf901835c9440c824a818057870ee544d1ecbea089","observation_id":"4d4d3ffb-4e11-41ee-9a8b-d23e084a3566","resolution":{"observed_at":"2026-08-06T13:56:22.619018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-08T17:24:54.634750Z","title":"arXiv preprint arXiv:2411.02193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04904","last_updated":"2026-08-06T04:47:27Z","snapshot_observed_at":"2026-08-18T19:39:39.291438Z","submitted_at":"2026-08-05T14:32:14Z","title":"Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:24:54.634750Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2608.04904"},"observation_digest":"sha256:77a04778ba87b3132e91f563dac01fb317000e0fe3e4ce72ce94557fe4c8b276","observation_id":"2a5b0956-a5ef-4e89-837b-69cc09f4c8ac","resolution":{"observed_at":"2026-08-08T17:24:54.634750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-14T04:44:58.116351Z","title":"arXiv preprint arXiv:2411.02193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08383","last_updated":"2026-08-09T00:29:54Z","snapshot_observed_at":"2026-08-18T00:12:18.641452Z","submitted_at":"2026-08-09T00:29:54Z","title":"Safety Cost of Steering Vectors Is Separable and Reducible","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:44:58.116351Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2608.08383"},"observation_digest":"sha256:ef5a3d2734e2fa0157ed5d0ef924d0edaec0b5202cc5ab86cfba5fdf88cf625b","observation_id":"89d40b0a-aac5-4717-bc22-07248c76fd78","resolution":{"observed_at":"2026-08-14T04:44:58.116351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-14T04:29:55.042128Z","title":"Improving steer- ing vectors by targeting sparse autoencoder features,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08757","last_updated":"2026-08-09T15:16:58Z","snapshot_observed_at":"2026-08-18T08:26:23.511508Z","submitted_at":"2026-08-09T15:16:58Z","title":"Steering dense music retrieval with open-vocabulary concept discovery","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:55.042128Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2608.08757"},"observation_digest":"sha256:acbe383819648e4725c23a31a9f539e1e6bba352f0c2c3ea1cb9c1d6d253b215","observation_id":"43ba2f96-a5c6-4735-86fe-6cae3d525ce5","resolution":{"observed_at":"2026-08-14T04:29:55.042128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-11T04:17:55.782849Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-18T09:13:54.775583Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:55.782849Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:f8986227b91305e39d824c146a9d5b15a1399451cb2444e639ed5ce8cdec44a5","observation_id":"bae5706b-c4c3-4713-829f-3cfd8479df19","resolution":{"observed_at":"2026-08-11T04:17:55.782849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-14T13:29:00.072086Z","title":"Improving steering vectors by targeting sparse autoencoder features","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13337","last_updated":"2026-08-13T15:06:56Z","snapshot_observed_at":"2026-08-16T23:12:47.764488Z","submitted_at":"2026-08-13T15:06:56Z","title":"Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T13:29:00.072086Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2608.13337"},"observation_digest":"sha256:86c8e3f6b1d0c94b2a037f78c0fdea8f0bc0289412dda67ccd36b86fe6d759f7","observation_id":"28912497-2ae8-455e-bef5-4dac6d18dc86","resolution":{"observed_at":"2026-08-14T13:29:00.072086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.02193/citation-record","integrity":"/paper/2411.02193/integrity","json":"/paper/2411.02193/citation-record.json","paper":"/paper/2411.02193"},"outbound":[],"paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2411.02193."}