{"as_of":"2026-08-17T00:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c6692d6145dc56684f191152f33f6cac7518ceff9dd2b7939941ae0e46cdaff","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:29:34.141936Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-09T01:06:10.147605Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.03708","last_updated":"2025-05-28T19:52:55Z","snapshot_observed_at":"2026-08-16T20:00:52.543036Z","submitted_at":"2025-02-06T01:41:48Z","title":"Toward universal steering and monitoring of AI models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T01:06:10.147605Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2502.03708"},"observation_digest":"sha256:9101ffea6046357c1d56df6776d7843f2be5acda3925f9d1b5887e57e329ec50","observation_id":"c213a571-1f47-4cf7-bf24-0257b25e7655","resolution":{"observed_at":"2026-08-09T01:06:10.147605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-16T12:29:34.141936Z","title":"Man- ning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12939","last_updated":"2025-04-17T13:37:47Z","snapshot_observed_at":"2026-08-16T12:16:51.698354Z","submitted_at":"2025-04-17T13:37:47Z","title":"Disentangling Polysemantic Channels in Convolutional Neural Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:34.141936Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2504.12939"},"observation_digest":"sha256:a5662095f15b0959e2f35c427b74b8638bff7f2a335c818e0704dd07295c8392","observation_id":"11c5b09b-adb1-4bb7-8871-25e75ff5c78f","resolution":{"observed_at":"2026-08-16T12:29:34.141936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-16T12:19:44.465708Z","title":"D., and Potts, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-16T12:11:33.306736Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.465708Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:6b846fdd0431ba71f4550ced4f8c5fa053d4756a13a3e2e356f249b6d2184a37","observation_id":"e4670055-fc91-487f-9650-02c24615c8a9","resolution":{"observed_at":"2026-08-16T12:19:44.465708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-16T11:35:04.755554Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15133","last_updated":"2025-09-14T08:10:18Z","snapshot_observed_at":"2026-08-16T11:30:20.276974Z","submitted_at":"2025-04-21T14:33:55Z","title":"EasyEdit2: An Easy-to-use Steering Framework for Editing Large Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T11:35:04.755554Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2504.15133"},"observation_digest":"sha256:2e3b7502b98393976f6f54f93f030f7198f03315cbc576086403a26daa33d0ab","observation_id":"543ff38d-cc52-4e58-ae80-9fa7891252f6","resolution":{"observed_at":"2026-08-16T11:35:04.755554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-16T04:25:06.093358Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01372","last_updated":"2025-05-02T16:18:40Z","snapshot_observed_at":"2026-08-16T04:17:15.323462Z","submitted_at":"2025-05-02T16:18:40Z","title":"Evaluating Explanations: An Explanatory Virtues Framework for Mechanistic Interpretability -- The Strange Science Part I.ii","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T04:25:06.093358Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.01372"},"observation_digest":"sha256:f779efc66daaa5a4de8b677bb985d6b8180f12a037716dbdf587e9a6ad1f30aa","observation_id":"74a24061-0e17-4599-a309-ec652df7de8d","resolution":{"observed_at":"2026-08-16T04:25:06.093358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T15:30:22.282961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15038","last_updated":"2025-07-29T21:40:42Z","snapshot_observed_at":"2026-08-11T11:13:14.945707Z","submitted_at":"2025-05-21T02:45:11Z","title":"Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:22.282961Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.15038"},"observation_digest":"sha256:a3d09f4580823b8ef89709978fb550189924334f62e61f85285dd3efb06c4463","observation_id":"7a9fc4e6-95b4-4fb6-a4ba-502bb7e25f20","resolution":{"observed_at":"2026-08-07T15:30:22.282961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T15:01:51.732241Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16612","last_updated":"2025-10-14T08:28:41Z","snapshot_observed_at":"2026-08-16T03:55:54.861868Z","submitted_at":"2025-05-22T12:47:16Z","title":"Steering Large Language Models for Machine Translation Personalization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:01:51.732241Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.16612"},"observation_digest":"sha256:afe0d1569b6a69cc31a5ecc815b0dcb59f8c8fe4cc44054bc953a105cd4bf53c","observation_id":"31cea893-d830-4649-a4bb-38ba2a5f3b78","resolution":{"observed_at":"2026-08-07T15:01:51.732241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T14:20:58.857369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19333","last_updated":"2025-05-25T21:40:26Z","snapshot_observed_at":"2026-08-07T14:14:16.527884Z","submitted_at":"2025-05-25T21:40:26Z","title":"Evaluating Steering Techniques using Human Similarity Judgments","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:58.857369Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.19333"},"observation_digest":"sha256:f985b410761a50459ff21bc308788bf3d4e2f1ef1d6995c7a41fc22e504002eb","observation_id":"f67b55c0-fde2-4415-afdd-9906c7cd1c92","resolution":{"observed_at":"2026-08-07T14:20:58.857369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T13:51:33.503653Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20809","last_updated":"2025-05-27T07:16:40Z","snapshot_observed_at":"2026-08-16T11:33:06.143848Z","submitted_at":"2025-05-27T07:16:40Z","title":"Improved Representation Steering for Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:51:33.503653Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2505.20809"},"observation_digest":"sha256:525569848e77c8a3e3ee853325d910176d63ef7b4447918c57e83b92ede4f807","observation_id":"0bbd5b28-16ef-422c-85fd-6ec1fde77f96","resolution":{"observed_at":"2026-08-07T13:51:33.503653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T12:13:19.564287Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00253","last_updated":"2025-06-08T23:37:10Z","snapshot_observed_at":"2026-08-16T12:44:03.115603Z","submitted_at":"2025-05-30T21:41:44Z","title":"Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:19.564287Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.00253"},"observation_digest":"sha256:0882ad576af2bce3c4ed25d72fc0a5900b97118becfd811db52068ca4f656f63","observation_id":"23e4f887-4e7a-45ad-ad63-9c1688b592c9","resolution":{"observed_at":"2026-08-07T12:13:19.564287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T12:07:11.939328Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00653","last_updated":"2025-06-04T19:24:26Z","snapshot_observed_at":"2026-08-08T10:11:59.833732Z","submitted_at":"2025-05-31T17:45:18Z","title":"Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:11.939328Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.00653"},"observation_digest":"sha256:31df9d56148cc427399ae02ceb5c02dd61f701610a94668516f1e536a9f5d2a2","observation_id":"a44a648d-3daf-4ca6-80dc-25d7bcf6f345","resolution":{"observed_at":"2026-08-07T12:07:11.939328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T11:11:19.096812Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03292","last_updated":"2025-06-03T18:32:01Z","snapshot_observed_at":"2026-08-16T11:34:27.508626Z","submitted_at":"2025-06-03T18:32:01Z","title":"HyperSteer: Activation Steering at Scale with Hypernetworks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:11:19.096812Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.03292"},"observation_digest":"sha256:3ba88fee35180eb0b28f963a5139d87bf1779289298146db3a3e1a195ed5ffc3","observation_id":"de4cbd8d-1c7a-408d-9bbd-93ecc67f2526","resolution":{"observed_at":"2026-08-07T11:11:19.096812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T10:40:16.702496Z","title":"D.; and Potts, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04774","last_updated":"2025-06-05T09:06:59Z","snapshot_observed_at":"2026-08-16T20:57:58.252260Z","submitted_at":"2025-06-05T09:06:59Z","title":"Fine-Grained Interpretation of Political Opinions in Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:40:16.702496Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.04774"},"observation_digest":"sha256:e1ae9b984cb009009b721ba0896e7edb79bd29b692a0a1242298be31c80c6626","observation_id":"8f410453-9292-436c-a201-524a7700f897","resolution":{"observed_at":"2026-08-07T10:40:16.702496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T04:45:42.741450Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09967","last_updated":"2025-06-13T18:01:49Z","snapshot_observed_at":"2026-08-16T18:22:58.807410Z","submitted_at":"2025-06-11T17:44:01Z","title":"Resa: Transparent Reasoning Models via SAEs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:42.741450Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.09967"},"observation_digest":"sha256:ab5ad73ffe3d943db6fc51ddbdcc7d99d07f99cbecbb4b4a128247475e93a1cc","observation_id":"48448f35-3dc6-4cb3-b0e2-fd117fefe50a","resolution":{"observed_at":"2026-08-07T04:45:42.741450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-07T01:03:41.633267Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12217","last_updated":"2025-06-13T20:40:13Z","snapshot_observed_at":"2026-08-13T15:09:57.842743Z","submitted_at":"2025-06-13T20:40:13Z","title":"From Emergence to Control: Probing and Modulating Self-Reflection in Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T01:03:41.633267Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.12217"},"observation_digest":"sha256:48b21e5c202172bc0f5a4d6d8a787e0d04717fc2df80c3adb421790f4ccecd73","observation_id":"aa3cfd68-4461-42d7-9c7b-067819b1df5e","resolution":{"observed_at":"2026-08-07T01:03:41.633267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-06T21:34:33.631283Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23845","last_updated":"2026-07-04T18:58:34Z","snapshot_observed_at":"2026-08-13T00:26:02.171551Z","submitted_at":"2025-06-30T13:35:56Z","title":"Position: Use Sparse Autoencoders to Discover Unknowns","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:33.631283Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2506.23845"},"observation_digest":"sha256:b83c11659effbfaadf3deb34bd2b5998d926c4eb4ce1ff581cd668d99ec8bab8","observation_id":"686e0ed0-7129-44b5-add7-9373dae8b45e","resolution":{"observed_at":"2026-08-06T21:34:33.631283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-06T16:40:44.637794Z","title":"D., and Potts, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12950","last_updated":"2025-07-18T09:19:19Z","snapshot_observed_at":"2026-08-14T04:45:48.605049Z","submitted_at":"2025-07-17T09:43:20Z","title":"Insights into a radiology-specialised multimodal large language model with sparse autoencoders","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:40:44.637794Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2507.12950"},"observation_digest":"sha256:30eeafcdea27b812098e05ac30bc9277760e3779bd13523ded7df967560e7c5a","observation_id":"ecec1d06-3b49-41fc-859c-0a010f994c08","resolution":{"observed_at":"2026-08-06T16:40:44.637794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T17:18:55.749890Z","title":"Zhengxuan Wu, Aryaman Arora, Atticus Geiger, Zheng Wang, Jing Huang, Dan Jurafsky, Christo- pher D Manning, and Christopher Potts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16560","last_updated":"2026-07-07T00:22:17Z","snapshot_observed_at":"2026-08-09T16:18:10.268970Z","submitted_at":"2025-08-22T17:26:33Z","title":"Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:18:55.749890Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2508.16560"},"observation_digest":"sha256:840c8b8d7e6689e19354c068aab97ab0b8e2f052b4929a8b91ba8ffeb42cd42b","observation_id":"5f90aaef-7103-4c7f-a616-dc6de6694890","resolution":{"observed_at":"2026-08-05T17:18:55.749890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T18:47:45.341219Z","title":"URL https://arxiv.org/abs/2501.17148","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-05T18:44:01.835548Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.341219Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:91312847fb0ad4a1ed6c36820119049b92fbb28901a59ae773bebd85fe285469","observation_id":"3d6046e9-9891-47b7-b248-19a4ac46b9a4","resolution":{"observed_at":"2026-08-05T18:47:45.341219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-04T22:18:44.791907Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09715","last_updated":"2025-09-09T05:50:08Z","snapshot_observed_at":"2026-08-14T01:26:37.511614Z","submitted_at":"2025-09-09T05:50:08Z","title":"Investigating Symbolic Triggers of Hallucination in Gemma Models Across HaluEval and TruthfulQA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:18:44.791907Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2509.09715"},"observation_digest":"sha256:e2afdc6299891ac6578be54f3f043cc2f5649dc575164fa835ede00dbbf50c3a","observation_id":"64bae72e-6f2d-45e3-a86e-bcd48d11aca8","resolution":{"observed_at":"2026-08-04T22:18:44.791907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-04T13:45:27.597133Z","title":"Axbench: Steering llms? even simple baselines outper- form sparse autoencoders.arXiv preprint arXiv:2501.17148,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25533","last_updated":"2026-07-06T05:00:34Z","snapshot_observed_at":"2026-08-15T00:48:09.754756Z","submitted_at":"2025-09-29T21:43:18Z","title":"VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:45:27.597133Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2509.25533"},"observation_digest":"sha256:7a33a9fe5c01b4d2a7546df3c27153b907de9341250c4393270a407f9ad2ce3d","observation_id":"fef9a84f-9bd2-402d-979e-78f556efb848","resolution":{"observed_at":"2026-08-04T13:45:27.597133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-03T18:33:09.003812Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05038","last_updated":"2026-05-29T17:42:38Z","snapshot_observed_at":"2026-08-07T15:13:01.011752Z","submitted_at":"2025-12-04T17:55:55Z","title":"The SuperActivator Mechanism: Transformers Concentrate Reliable Concept Signals in the Tail","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T18:33:09.003812Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2512.05038"},"observation_digest":"sha256:c50a20007237cd0418895dc0938b158e68e6186346ce255a72ba10fb59f0636c","observation_id":"6a29067e-97b4-4317-a117-068745e3b2cc","resolution":{"observed_at":"2026-08-03T18:33:09.003812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.05715","last_updated":"2026-05-07T05:58:38Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:58:38Z","title":"Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-08T11:42:16.090162Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.05715"},"observation_digest":"sha256:207fbf824aabc5cc5de9a5be2b7c0625e39c1fda3d37ab4defe6827f01a349ae","observation_id":"25cc1439-9855-45b6-90e2-52c1d205dc7e","resolution":{"observed_at":"2026-05-11T19:31:10.587655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-13T14:35:55.998029Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:06.234399Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:eff3c3af31880b7fffb68ec61b9f718b19fec41c03f3686fbfad6f32d9a1649a","observation_id":"999f74ea-7573-496a-b670-863bce46d67f","resolution":{"observed_at":"2026-05-12T00:51:15.332661Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-13T14:35:55.998029Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T21:21:37.185232Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:07c71606e08485440f2b0c46674622eed6bb8bd3621c312264b2fb4ccfdb9034","observation_id":"c9542428-9d16-464c-9340-0a67098a26b5","resolution":{"observed_at":"2026-05-14T21:22:58.969437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-13T14:35:55.998029Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T17:06:03.483247Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:6c71552251e74e72b8e03cb3d3de5ba27add184e0c2aedc4910a9b96424e7585","observation_id":"cbcdd5f3-9ca9-4d3e-921f-0895e37a543a","resolution":{"observed_at":"2026-05-19T17:07:41.693739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-13T14:35:55.998029Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:41:36.199099Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:f98e3700fa655c82c5a3086ce4c1f9688e6ee3feade9370d618997f69afe26ea","observation_id":"dc19f809-2c50-4736-a7d6-263c18fb155f","resolution":{"observed_at":"2026-06-30T23:45:08.055382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.10601","last_updated":"2026-05-11T14:02:56Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:02:56Z","title":"The Open-Box Fallacy: Why AI Deployment Needs a Calibrated Verification Regime","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T03:37:12.567351Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.10601"},"observation_digest":"sha256:f2393bee026d7451b937474c43d5047dcf85b60c537812d7e271be71ef77179c","observation_id":"cf6380e4-61c1-493d-9226-07ebcd27f71b","resolution":{"observed_at":"2026-05-12T07:11:26.524548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-08-11T04:19:07.969715Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:7b6ec73443478597acf17204ae5dc8db2213b57e0555dc58bdd4a5b3ceb5b7d8","observation_id":"03000c2e-bb75-415a-8a01-5338990b0c2b","resolution":{"observed_at":"2026-05-13T05:22:18.867569Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T07:46:41.159688Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:47c30d46a9a4a5214b50b031d285da7d10a3b65ee3f6a166ba6da06c67cb19cb","observation_id":"5273eeed-d53c-4b66-aa4e-adcbe3a4aacb","resolution":{"observed_at":"2026-05-21T07:49:50.175124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-08-16T02:39:37.630021Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T22:36:12.466550Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:a4eebbc404029b4a852c74f67f11469c76482b9c066a9a61af9e27f542837b9a","observation_id":"d5d1b455-8957-4939-afef-686d00f5552e","resolution":{"observed_at":"2026-05-20T22:39:10.652456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.16362","last_updated":"2026-05-20T21:23:48Z","snapshot_observed_at":"2026-08-16T02:39:37.630021Z","submitted_at":"2026-05-09T14:26:49Z","title":"When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:59:32.201925Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.16362"},"observation_digest":"sha256:dc11a431fadafbbe6fb751e158335695510d16e7f512bb1ab53f7baa84389ab9","observation_id":"420f821d-c186-40f2-8e77-c80e1bd8075a","resolution":{"observed_at":"2026-05-22T10:01:23.537374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.18229","last_updated":"2026-05-18T11:20:57Z","snapshot_observed_at":"2026-08-15T13:05:39.630785Z","submitted_at":"2026-05-18T11:20:57Z","title":"Are Sparse Autoencoder Benchmarks Reliable?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T12:43:13.014365Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.18229"},"observation_digest":"sha256:04118f80e6a87bc5f3982914bfa08c663a8b369fbc4bd1bddc88127c25ec4e7d","observation_id":"037a966f-e60b-465f-aa09-3c95ed64ef6f","resolution":{"observed_at":"2026-05-20T12:43:16.805970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2605.28664","last_updated":"2026-05-27T15:59:45Z","snapshot_observed_at":"2026-08-14T06:30:00.621358Z","submitted_at":"2026-05-27T15:59:45Z","title":"Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T13:53:27.306664Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2605.28664"},"observation_digest":"sha256:38060c525f9522e1664a155556463ed5bcb61ebb7062768a385332306cc2a7dc","observation_id":"f63048b1-1502-4a22-91ff-0f9842ba83ec","resolution":{"observed_at":"2026-06-29T14:03:29.907469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:ce0cc1762d2431c93c8b6acccd903c670cb1281b2c543bb28eb420f3f2b33149","observation_id":"8e55ea6d-c6f2-4dd1-a1a5-9344dddd060a","resolution":{"observed_at":"2026-07-01T14:05:47.199446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"AxBench: Steering LLMs? even simple baselines outperform sparse autoencoders.arXiv preprint arXiv:2501.17148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:cafc6db4f28ca587a36ba3457502e609344afe1d7f8725a45a74272bca15af76","observation_id":"1b40c27b-9c83-451e-bbbd-1341a9ee321f","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.11599","last_updated":"2026-06-10T02:55:34Z","snapshot_observed_at":"2026-08-15T02:24:43.533624Z","submitted_at":"2026-06-10T02:55:34Z","title":"When is Your LLM Steerable?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T10:01:21.682285Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.11599"},"observation_digest":"sha256:b2068f13c75a138aa792d45b5d30858ae8bd3c897ffc8b9cda97e52997f5e3b9","observation_id":"e3ba96c8-ca5b-4522-8973-6c0e25c6d87e","resolution":{"observed_at":"2026-07-03T10:27:56.578484Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.12360","last_updated":"2026-06-10T17:31:16Z","snapshot_observed_at":"2026-08-15T04:26:22.769006Z","submitted_at":"2026-06-10T17:31:16Z","title":"Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-06-27T10:32:57.295159Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.12360"},"observation_digest":"sha256:f15e9b3003997a42262960d189086b14b70f43358f699db968a325072db22d3c","observation_id":"e79bbe08-8e29-4e61-8e50-6f9acde5ce5b","resolution":{"observed_at":"2026-07-03T09:07:47.864621Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":"2501.17148","doi":"10.48550/arxiv.2501.17148","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":"ArXiv.org","work_id":"22727034-2f4f-4d5e-a785-e95a62081ef2","year":2025},"citing_paper":{"arxiv_id":"2606.15054","last_updated":"2026-06-29T22:04:02Z","snapshot_observed_at":"2026-08-03T01:16:15.417885Z","submitted_at":"2026-06-13T01:51:05Z","title":"Size Doesn't Matter: Cosine-Scored Sparse Autoencoders","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T07:15:16.674714Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2606.15054"},"observation_digest":"sha256:323ff8bf5cc8878b88312566ed794dae35c9837431dbe7480564d58e9de78ef4","observation_id":"71cc1d01-e169-4ee8-bfb5-708a7379f935","resolution":{"observed_at":"2026-07-01T07:15:29.624121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-01T20:58:54.009938Z","title":"Manning, and Christopher Potts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16448","last_updated":"2026-07-17T18:47:31Z","snapshot_observed_at":"2026-08-14T19:26:18.674556Z","submitted_at":"2026-07-17T18:47:31Z","title":"Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T20:58:54.009938Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2607.16448"},"observation_digest":"sha256:8bac73694a47b639e48b54c1d8de209997a4bb342ceadc5d29d841e294c6d7f2","observation_id":"67b37175-3b56-4910-984d-8f416ca019f6","resolution":{"observed_at":"2026-08-01T20:58:54.009938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-02T13:56:50.382262Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18259","last_updated":"2026-05-15T15:34:48Z","snapshot_observed_at":"2026-08-08T01:48:17.759173Z","submitted_at":"2026-05-15T15:34:48Z","title":"Probabilistic Concept-Aware Steering for Trustworthy LLM Inference","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-02T13:56:50.382262Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2607.18259"},"observation_digest":"sha256:0ed93270986f5a586b763c64efc70386e73adaef37d7b9c5a42d2c2e6d55a77d","observation_id":"608fb2c6-208f-4036-b5af-45253a520b6a","resolution":{"observed_at":"2026-08-02T13:56:50.382262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-15T15:00:38.184550Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders.arXiv preprint arXiv:2501.17148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02957","last_updated":"2026-08-03T23:42:24Z","snapshot_observed_at":"2026-08-16T10:20:50.109284Z","submitted_at":"2026-08-03T23:42:24Z","title":"Inverted Detection and Control in Steering Vectors","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:00:38.184550Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2608.02957"},"observation_digest":"sha256:d69f8719a8f43501515f9700686f58f1e85bb725c871c584c2d7a7afd6a2eba3","observation_id":"7ee8c3dc-41ae-45d0-9aa5-9d79a82c5a87","resolution":{"observed_at":"2026-08-15T15:00:38.184550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-06T22:56:06.016314Z","title":"arXiv preprint arXiv:2501.17148 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04524","last_updated":"2026-08-05T06:56:58Z","snapshot_observed_at":"2026-08-15T14:03:29.983312Z","submitted_at":"2026-08-05T06:56:58Z","title":"ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:56:06.016314Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2608.04524"},"observation_digest":"sha256:15c3477e036e6dd10b61776763c9823a9a58104132f4ff6c0956c1250eaa401a","observation_id":"c2b9c053-81bb-4ef3-8471-255f8b679817","resolution":{"observed_at":"2026-08-06T22:56:06.016314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-08T00:27:20.702277Z","title":"Axbench: Steering llms? even simple baselines outperform sparse autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05732","last_updated":"2026-08-06T08:17:50Z","snapshot_observed_at":"2026-08-13T17:33:12.965168Z","submitted_at":"2026-08-06T08:17:50Z","title":"CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:27:20.702277Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2608.05732"},"observation_digest":"sha256:271a5826e6ded836513275e0939c793ec042ec914bf6e4b1edbb784d4bdc9e6a","observation_id":"52a1fa14-295f-46b4-87ae-5d6cc4258b0b","resolution":{"observed_at":"2026-08-08T00:27:20.702277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-11T00:36:58.518062Z","title":"arXiv preprint arXiv:2501.17148 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07594","last_updated":"2026-08-06T04:29:58Z","snapshot_observed_at":"2026-08-16T23:09:03.642232Z","submitted_at":"2026-08-06T04:29:58Z","title":"Scaling Inherently Interpretable Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T00:36:58.518062Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2608.07594"},"observation_digest":"sha256:7678b3b7675a9a2a5bb221ee95cceb11955b450c043d496d0d957e722aefd41d","observation_id":"3bc2e44e-d022-4b63-a352-5777f5fe446c","resolution":{"observed_at":"2026-08-11T00:36:58.518062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.17148/citation-record","integrity":"/paper/2501.17148/integrity","json":"/paper/2501.17148/citation-record.json","paper":"/paper/2501.17148"},"outbound":[],"paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T12:58:32.947185Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2501.17148."}