{"as_of":"2026-08-19T06:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b1d7de40391b673d2ee1099c4bc5a04cb4fa6db940d5f16625263a41f4845c7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:43:45.651719Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00509/citation-record","integrity":"/paper/2505.00509/integrity","json":"/paper/2505.00509/citation-record.json","paper":"/paper/2505.00509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.506675Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.506675Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:926a1eb6f8f7e509a75d4eca2e016038e90492c47fae58c9de32ab67a45a0694","observation_id":"4ea825f7-0835-4a2d-94b6-fbab139c7034","resolution":{"observed_at":"2026-08-16T04:43:45.506675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:46.090002Z","title":"Language Models Can Explain Neurons in Language Models , May 2023","venue":null,"work_id":"e91196b1-80dc-4005-8024-54caf40e2afb","year":2023},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.512439Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:f2f55b4d9cfdd9787a6fc6e6a99e4362156cddb7c0755214d8458c2693c7b0c0","observation_id":"6af40797-922c-432f-b2ea-332e20faa2b1","resolution":{"observed_at":"2026-08-16T04:43:46.093263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.516143Z","title":"GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow , March 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.516143Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:22e74b35cd8720b933e315c199439ba3e60959a78e8daeb071f62543f96dbb52","observation_id":"a997d328-5dde-4958-bfa8-8085284a4226","resolution":{"observed_at":"2026-08-16T04:43:45.516143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04332","last_updated":"2024-11-29T18:52:41Z","snapshot_observed_at":"2026-08-17T16:17:43.920184Z","submitted_at":"2024-10-06T02:43:49Z","title":"Gradient Routing: Masking Gradients to Localize Computation in Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04332","snapshot_observed_at":"2026-08-16T04:43:45.520989Z","title":"Gradient routing: Masking gradients to localize computation in neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.520989Z"},"links":{"cited_paper":"/paper/2410.04332","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:016cc68ad592f0a317dbc512538dad28a400388484ce4535daf2331fa18995f7","observation_id":"03bbbbab-a3c2-401e-b729-5c48f1369363","resolution":{"observed_at":"2026-08-16T04:43:45.520989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:46.078049Z","title":"Mavor-Parker, Aengus Lynch, Stefan Heimersheim, and Adri \\`a Garriga-Alonso","venue":null,"work_id":"52d33946-b131-4d77-a9d6-3cee420a39c0","year":2023},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.525545Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:3ce8f6d0398598973670adc70b3884bbd91c4bd1689aef7c23360bb7f6cedcb7","observation_id":"49852d33-27fc-47d1-98ce-2b0c8598d3dd","resolution":{"observed_at":"2026-08-16T04:43:46.081343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-19T04:05:48.812216Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-16T04:43:45.529143Z","title":"Tinystories: How small can language models be and still speak coherent english?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.529143Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:eff2ff24fe5eb2fc7ffd6af66881b4b5d49480d0899944815250033b7e6305f4","observation_id":"ea230a7e-0b3e-4bd8-a0d6-707adb01d225","resolution":{"observed_at":"2026-08-16T04:43:45.529143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19911","last_updated":"2023-05-31T14:44:33Z","snapshot_observed_at":"2026-08-19T04:46:36.152055Z","submitted_at":"2023-05-31T14:44:33Z","title":"Neuron to Graph: Interpreting Language Model Neurons at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19911","snapshot_observed_at":"2026-08-16T04:43:45.533558Z","title":"Neuron to graph: Interpreting language model neurons at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.533558Z"},"links":{"cited_paper":"/paper/2305.19911","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:d8405cb3d198331f7d43f01c0ac6ad3ab24ecf8005f41b67d773cb3db64dd50a","observation_id":"28990087-6b1a-4341-9be6-fa54a9325584","resolution":{"observed_at":"2026-08-16T04:43:45.533558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12918","last_updated":"2023-04-22T19:06:13Z","snapshot_observed_at":"2026-08-19T04:34:50.084932Z","submitted_at":"2023-04-22T19:06:13Z","title":"N2G: A Scalable Approach for Quantifying Interpretable Neuron Representations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12918","snapshot_observed_at":"2026-08-16T04:43:45.537514Z","title":"N2g: A scalable approach for quantifying interpretable neuron representations in large language models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.537514Z"},"links":{"cited_paper":"/paper/2304.12918","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:7809c5f3e503ac5f04f89e4f792712e13e102790687250db7fe88a71e05c3872","observation_id":"3655251c-b0ab-4b08-81bb-5cec5437e60f","resolution":{"observed_at":"2026-08-16T04:43:45.537514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.01611","last_updated":"2020-07-20T16:50:33Z","snapshot_observed_at":"2026-08-19T04:46:57.917192Z","submitted_at":"2019-03-05T00:52:12Z","title":"Stabilizing the Lottery Ticket Hypothesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.01611","snapshot_observed_at":"2026-08-16T04:43:45.541038Z","title":"Stabilizing the lottery ticket hypothesis","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.541038Z"},"links":{"cited_paper":"/paper/1903.01611","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:d43bc1581892b6d7063ed2871a8e79287f74fbd91728adba17f68ae2fb51259e","observation_id":"c9449e0d-058e-4163-821a-0bfa8d659aa5","resolution":{"observed_at":"2026-08-16T04:43:45.541038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T04:43:45.544672Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.544672Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:b12fdd860a185f682310944c8776a14874cb76c5c6b6b8a6fdb1c9c246eda06b","observation_id":"d137550d-efa3-4484-a9b5-14f9bc90c2d4","resolution":{"observed_at":"2026-08-16T04:43:45.544672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-16T04:43:45.548149Z","title":"Scaling and evaluating sparse autoencoders, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.548149Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:8a00cd93de2c65e543e88110ba106f68320631576225a27acd905bc6e74cc0f8","observation_id":"22536831-2b59-4e7e-bb65-266c137f10de","resolution":{"observed_at":"2026-08-16T04:43:45.548149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T04:43:45.551102Z","title":"Gemini: A Family of Highly Capable Multimodal Models , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.551102Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:24c94030bb7c9c003527db9e0ac11c1bc8239f58de0a4178ff41b4047feaaa4a","observation_id":"6e7901d4-411d-4bd2-86d9-c2dc3eaf38f7","resolution":{"observed_at":"2026-08-16T04:43:45.551102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-16T04:43:45.553635Z","title":"Frontiermath: A benchmark for evaluating advanced mathematical reasoning in ai, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.553635Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:4f9d253452598f63c1942ada0fc0b592d98d8323a7a146a400aa08d57c13429a","observation_id":"ed9e84da-f5f8-4d37-9d15-a0b2c8c5f419","resolution":{"observed_at":"2026-08-16T04:43:45.553635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.556523Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.556523Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:415b244bbdb22d75e694e639c992a68e605ef72b257c8e8a59e1c42ed8a8ba1f","observation_id":"2ee220c7-6eb6-4ed7-acbb-c9720dd2504f","resolution":{"observed_at":"2026-08-16T04:43:45.556523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.559097Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.559097Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:132ce475eceb6d55fb7f7acb8482e6d8f95fa839596023af22524fdf24d757c8","observation_id":"8cad3ac6-af2f-494a-8f5f-5cea8ad1eb35","resolution":{"observed_at":"2026-08-16T04:43:45.559097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1088/2634-4386/ac7c8a","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.688885Z","title":"Two sparsities are better than one: unlocking the performance benefits of sparse–sparse networks","venue":null,"work_id":"e67b60ce-26ee-444a-8b96-68f1ce5281ab","year":2022},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.562081Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:592f74c53bc5e407dd25a7198938bedb85e257a3717f0d520c2324458bdf179a","observation_id":"c4327362-cad3-4d04-9892-6e50a7664e36","resolution":{"observed_at":"2026-08-16T04:43:45.694494Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.565343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.565343Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:3c6f3900bcf022d78f23788a9d877714edb4bb11dc226126fa4b5ed4ea74065d","observation_id":"269f3908-1896-4f84-9965-384c58b3db09","resolution":{"observed_at":"2026-08-16T04:43:45.565343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:46.048048Z","title":"Lazzaro, S","venue":null,"work_id":"4c3fc7cd-e8a3-4bf8-9854-182ac9f82acf","year":1988},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.568550Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:55f10270ffb1c7308f1bab6c3f92b8161464bb0ba55ad9c35f0e2d0dd2cb8ede","observation_id":"ba88fd9f-15d1-471c-b721-c4f32dd2e5d3","resolution":{"observed_at":"2026-08-16T04:43:46.052630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.571944Z","title":"Lecun, L","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.571944Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:3a4d2d68ac2fbe1a179abb8b60129e79017e8170435bcf00423eb9e5b9461fe8","observation_id":"6085f51d-8a80-4faa-9d84-051192654ce1","resolution":{"observed_at":"2026-08-16T04:43:45.571944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.575516Z","title":"Deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.575516Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:710abd0d8e337493d2e4d0a8cc7a92442ab84e31afbd54154cbf4bc632dbe193","observation_id":"1c4f1516-fa8e-4ad7-a72f-69555bf19ab9","resolution":{"observed_at":"2026-08-16T04:43:45.575516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03218","last_updated":"2024-05-15T19:16:09Z","snapshot_observed_at":"2026-08-15T06:18:34.739211Z","submitted_at":"2024-03-05T18:59:35Z","title":"The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03218","snapshot_observed_at":"2026-08-16T04:43:45.579184Z","title":"Li, Ann-Kathrin Dombrowski, Shashwat Goel, Long Phan, Gabriel Mukobi, Nathan Helm-Burger, Rassin Lababidi, Lennart Justen, Andrew B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.579184Z"},"links":{"cited_paper":"/paper/2403.03218","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:080adda7aa1584ba8598902ea278a8adc99b30206e517910bb349cee7d84d216","observation_id":"2cc3b821-cda7-435b-b31a-ca6d523c561c","resolution":{"observed_at":"2026-08-16T04:43:45.579184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19756","last_updated":"2025-02-09T21:09:09Z","snapshot_observed_at":"2026-08-15T02:33:31.807561Z","submitted_at":"2024-04-30T17:58:29Z","title":"KAN: Kolmogorov-Arnold Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19756","snapshot_observed_at":"2026-08-16T04:43:45.583081Z","title":"Hou, and Max Tegmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.583081Z"},"links":{"cited_paper":"/paper/2404.19756","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:deaaab211c3caa2ca8adb8cd28d692588f652e6571373c7fa5254f94c8a745b3","observation_id":"6dd5c797-503a-474a-8f15-643e781b03d7","resolution":{"observed_at":"2026-08-16T04:43:45.583081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:46.036426Z","title":"Majani, Ruth Erlanson, and Yaser Abu-Mostafa","venue":null,"work_id":"6ee24530-60b0-424c-8ac4-d0f022934107","year":1988},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.586889Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:57e1ca4cfda1d5389c4ee37342209d70ef315adf9158c5e30b030d5228c48ad5","observation_id":"82319611-8522-4537-8833-a45a97063fe5","resolution":{"observed_at":"2026-08-16T04:43:46.040037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:46.024397Z","title":"Transformer circuit evaluation metrics are not robust","venue":null,"work_id":"47d44a49-534e-458f-b027-1b7e096550e1","year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.590675Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:9323bfce5084f995a7f888cfcda539507cbbe99f4fa2763fdd9ef1af9672cc4f","observation_id":"b8c3debc-0212-48a1-b138-862bd6c09a29","resolution":{"observed_at":"2026-08-16T04:43:46.028393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:46.012429Z","title":"GPT-4o mini: advancing cost-efficient intelligence , 2024","venue":null,"work_id":"78747599-f7ee-41a0-a049-768e2d606cda","year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.594181Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:7dad0bdf5bec93dc6df6dd7748c6b3d5b4dce2d0041332acb2da409aa5c4844b","observation_id":"72949077-1963-4077-8d90-a55c1fad2c37","resolution":{"observed_at":"2026-08-16T04:43:46.016687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:43:45.597501Z","title":"GPT-4 Technical Report , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.597501Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:20c19c72c19c40f551659a7fe830671f59b7f51de7fa8f82f15114975af72b9d","observation_id":"a50be9b8-c0e8-4689-8843-2a24132ba8e9","resolution":{"observed_at":"2026-08-16T04:43:45.597501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.601541Z","title":"why should i trust you?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.601541Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:16c75f5abfc02f685f04786ac26385f86a23fc47361c13428dc5972b15fde4e0","observation_id":"9965ed0e-3f4f-4d70-ba14-cadc8ab51d42","resolution":{"observed_at":"2026-08-16T04:43:45.601541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10154","last_updated":"2019-09-22T03:05:09Z","snapshot_observed_at":"2026-08-19T04:33:49.747800Z","submitted_at":"2018-11-26T03:00:25Z","title":"Stop Explaining Black Box Machine Learning Models for High Stakes Decisions and Use Interpretable Models Instead","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10154","snapshot_observed_at":"2026-08-16T04:43:45.604891Z","title":"Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.604891Z"},"links":{"cited_paper":"/paper/1811.10154","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:27340b48f4fe3ec62bfbad3269412d84410da985b03281118e4cad0d4c060e79","observation_id":"3b5abdd8-36a2-4c5f-b059-bf60fb302c5c","resolution":{"observed_at":"2026-08-16T04:43:45.604891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:46.001076Z","title":"SAEBench: A Comprehensive Benchmark for Sparse Autoencoders - Dec 2024 , January 2025","venue":null,"work_id":"8323a5a7-c31d-4396-840b-724706dadade","year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.609196Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:04ae7d9ba75f2f09802200f94266bd0d0139761963da1669970db2c42bea45c5","observation_id":"98a2693c-06e7-46f3-b96a-6520b5e8bfad","resolution":{"observed_at":"2026-08-16T04:43:46.004687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-16T04:43:45.612842Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.612842Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:7998f2a66277e5ddb2512e7f9c8e7c7b12d42365ea51a7e341e9bd2f91ebbdc1","observation_id":"8ecd6819-0c28-4f33-8f3a-c9c8fc1fea21","resolution":{"observed_at":"2026-08-16T04:43:45.612842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.989247Z","title":"The neural lasso: Local linear sparsity for interpretable explanations","venue":null,"work_id":"ead55bce-3c69-4baf-a02b-5c705338a7ad","year":2018},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.615666Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:5218de676e1bf3e1385d3753f493a202a08d937648a53b3b191a5ad3064e8cf5","observation_id":"7003ab81-db8a-4725-880b-0d51a484d87d","resolution":{"observed_at":"2026-08-16T04:43:45.992816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.618279Z","title":"Dropout: A simple way to prevent neural networks from overfitting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.618279Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:f2f74f0295f2e512d085b8445fc59ee9757a27bcbdb707b8b0ca4487b6a07afe","observation_id":"369188da-d88d-4bae-b066-337bac871d4f","resolution":{"observed_at":"2026-08-16T04:43:45.618279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17230","last_updated":"2023-10-26T08:28:48Z","snapshot_observed_at":"2026-08-16T14:48:42.299196Z","submitted_at":"2023-10-26T08:28:48Z","title":"Codebook Features: Sparse and Discrete Interpretability for Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17230","snapshot_observed_at":"2026-08-16T04:43:45.621423Z","title":"Tamkin, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.621423Z"},"links":{"cited_paper":"/paper/2310.17230","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:c2925ee2c0db6a3b003757b068fcf0e37a04a8a07a2786060cbd7ebae202b75b","observation_id":"855a7c8c-0a35-4b55-88dd-0cbe1ec9fbd5","resolution":{"observed_at":"2026-08-16T04:43:45.621423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.624315Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.624315Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:49879958da55ba631717a40d36f2dac4529de9269326ba0546d54ce45538b0e3","observation_id":"78e7904b-0e24-4f5a-ab81-63482c1df7ab","resolution":{"observed_at":"2026-08-16T04:43:45.624315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.628392Z","title":"Interpretability in the wild: a circuit for indirect object identification in GPT -2 small","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.628392Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:797eb8a3a003d54ff5073a0491dc737d9277d58808b0ac81dd72abb835dab96e","observation_id":"342cadae-d6d4-4391-a89c-025172654035","resolution":{"observed_at":"2026-08-16T04:43:45.628392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.633209Z","title":"MMLU -pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.633209Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:3746c39fc6dfbc0be1c311fdf5144abc1fafc13842d20539e79db9d7e0f81932","observation_id":"c37afdf1-3b83-4e62-b18c-2dae14fe1f99","resolution":{"observed_at":"2026-08-16T04:43:45.633209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-16T04:43:45.637041Z","title":"Understanding deep learning requires rethinking generalization, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.637041Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:8cf61ed191cd9b6bc2d29c302987bb36f117afa9f26fc31c9db22f8f21131a06","observation_id":"18097027-a1fd-4a2c-bc16-d81cbbec50cc","resolution":{"observed_at":"2026-08-16T04:43:45.637041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.951622Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":"19efeb8a-a5d9-43c0-ab5a-ce5baa41ff1c","year":2024},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.640924Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:ea60c1fafc9e3634faa020589a23a4737cc6356c85bc16267e3f9695f600ee2d","observation_id":"578d8e96-1a14-493f-a267-199101320d09","resolution":{"observed_at":"2026-08-16T04:43:45.956445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.644152Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.644152Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:290c0e16cd0dd6cd9a71897d6ce287b351dadeb498f14870d6a143d5072523d3","observation_id":"70200a96-f2ef-4ca6-be3f-747401284603","resolution":{"observed_at":"2026-08-16T04:43:45.644152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.648135Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.648135Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:ce02238ec95bb37d5605db5ff05a10afccf97d7f412dc9b3f247ec442d933ed9","observation_id":"60a58f32-d57d-4753-9079-9dd0f9ee2460","resolution":{"observed_at":"2026-08-16T04:43:45.648135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:45.651719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:45.651719Z"},"links":{"citing_paper":"/paper/2505.00509"},"observation_digest":"sha256:64512c76dcf4d1ad93a7f1e60d4bd2bc820de98d04e74dc56a7217db59c8b1ef","observation_id":"12c73708-74c6-4cb9-8ced-61dd33e6d50a","resolution":{"observed_at":"2026-08-16T04:43:45.651719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00509","last_updated":"2025-05-01T13:25:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T04:34:10.490014Z","submitted_at":"2025-05-01T13:25:37Z","title":"Self-Ablating Transformers: More Interpretability, Less Sparsity"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.00509."}