{"as_of":"2026-08-09T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f21709e04244433d463207afe64d5ac32a557b6e8a64194df7caf0abca5430a8","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:12:13.917656Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:00.843301Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-07T14:03:00.843301Z","title":"Sparse autoencoders do not find canonical units of analysis.arXiv preprint arXiv:2502.04878, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20254","last_updated":"2025-05-26T17:31:36Z","snapshot_observed_at":"2026-08-08T03:52:01.664959Z","submitted_at":"2025-05-26T17:31:36Z","title":"Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.843301Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2505.20254"},"observation_digest":"sha256:95cc2a7d1806c1918d8ba67bc4b641c3bdaaaec6910b9a3ae840ca10240a392f","observation_id":"9472c785-10ea-4cc4-bee1-c5ab6b941e6d","resolution":{"observed_at":"2026-08-07T14:03:00.843301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-06T22:48:37.411622Z","title":"Sparse autoencoders do not find canonical units of analysis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20790","last_updated":"2025-09-04T11:41:34Z","snapshot_observed_at":"2026-08-09T03:26:19.673933Z","submitted_at":"2025-06-25T19:26:31Z","title":"Stochastic Parameter Decomposition","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:48:37.411622Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2506.20790"},"observation_digest":"sha256:eaa9434519aa4caea7f7c4c54a2d5a4a02a41da466f3c6b268ca5a6159aa7477","observation_id":"50f4f490-74c5-4fce-b7d5-385ecd300fd4","resolution":{"observed_at":"2026-08-06T22:48:37.411622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-06T16:40:29.030274Z","title":"Guohao Li, Hasan Abed Al Kader Hammoud, Hani Itani, Dmitrii Khizbullin, and Bernard Ghanem","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12990","last_updated":"2025-07-17T10:57:49Z","snapshot_observed_at":"2026-08-08T10:53:21.043716Z","submitted_at":"2025-07-17T10:57:49Z","title":"Teach Old SAEs New Domain Tricks with Boosting","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:29.030274Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2507.12990"},"observation_digest":"sha256:ee7f4955ff242315017b68b6f6423412240e3b18af5737b02d2e50b906a9f01f","observation_id":"158f39e2-2786-4adc-92dc-0e2a90c0ce6f","resolution":{"observed_at":"2026-08-06T16:40:29.030274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2511.01680","last_updated":"2026-07-15T14:09:50Z","snapshot_observed_at":"2026-08-04T00:23:23.110922Z","submitted_at":"2025-11-03T15:42:32Z","title":"Making Interpretable Discoveries from Unstructured Data: A High-Dimensional Multiple Hypothesis Testing Approach","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T01:56:50.978054Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2511.01680"},"observation_digest":"sha256:17ac253392f3a0dceb56166246a125baab7ee658a4103269d1d0672c075b78cf","observation_id":"899a1934-92c6-408c-95e4-b7e8a9da13b8","resolution":{"observed_at":"2026-05-18T02:00:40.006102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-04T00:23:28.785151Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis , February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01680","last_updated":"2026-07-15T14:09:50Z","snapshot_observed_at":"2026-08-04T00:23:23.110922Z","submitted_at":"2025-11-03T15:42:32Z","title":"Making Interpretable Discoveries from Unstructured Data: A High-Dimensional Multiple Hypothesis Testing Approach","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T00:23:28.785151Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2511.01680"},"observation_digest":"sha256:d1e6544b5da3be8b4095ada182cdd8aa359f9d96a3405cfe2c013f8648235017","observation_id":"f241173c-da4b-4c12-9b56-37ad8c59b6ac","resolution":{"observed_at":"2026-08-04T00:23:28.785151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-03T04:36:01.693349Z","title":"org/CorpusID:235458009","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2602.04718","last_updated":"2026-08-02T10:23:11Z","snapshot_observed_at":"2026-08-08T20:37:27.989363Z","submitted_at":"2026-02-04T16:29:14Z","title":"Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T04:36:01.693349Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2602.04718"},"observation_digest":"sha256:0b6c9368c6c1126f3106aa98654f7ff7d933ba14c69ccf26a8219816a4a42ede","observation_id":"fb0f0e78-985c-4cfb-9741-7beb6e1dfbe4","resolution":{"observed_at":"2026-08-03T04:36:01.693349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-04T06:15:55.771792Z","title":"org/CorpusID:235458009","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2602.04718","last_updated":"2026-08-02T10:23:11Z","snapshot_observed_at":"2026-08-08T20:37:27.989363Z","submitted_at":"2026-02-04T16:29:14Z","title":"Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T06:15:55.771792Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2602.04718"},"observation_digest":"sha256:8da2a3ec19c813eb431c4ffb8afd80cfd6e742ee2dd9677489211f48da64983a","observation_id":"383309bf-692f-4e12-bf36-4bc3435bf553","resolution":{"observed_at":"2026-08-04T06:15:55.771792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.07922","last_updated":"2026-05-11T02:18:14Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:57:37Z","title":"Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T03:13:58.543525Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.07922"},"observation_digest":"sha256:cff4625b9d4594cb190ad2a1333418a1e0841f4b28569d9603545a1c33775bc5","observation_id":"7048f3de-b19f-4ae9-af2e-5389e9cd3515","resolution":{"observed_at":"2026-05-11T03:15:54.363637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.07922","last_updated":"2026-05-11T02:18:14Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:57:37Z","title":"Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:50.776347Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.07922"},"observation_digest":"sha256:9814666f638555e9ca31b78636c884de004a5ed38a0f10ffe07461284fc9d8ff","observation_id":"7f31fb58-494e-45ad-bc04-5f179e4536d7","resolution":{"observed_at":"2026-05-12T07:16:25.329793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.08012","last_updated":"2026-05-08T17:01:55Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:01:55Z","title":"Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T02:42:47.178342Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.08012"},"observation_digest":"sha256:6e0241de1df3c4c9dfd824ac8d30f17230c3123becc26230b3f0f7e8c0ac7a52","observation_id":"dab9fcd5-3d2e-4065-85c4-0899531f3624","resolution":{"observed_at":"2026-05-11T02:45:58.161730Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.12122","last_updated":"2026-05-12T13:39:07Z","snapshot_observed_at":"2026-08-02T23:25:18.882744Z","submitted_at":"2026-05-12T13:39:07Z","title":"Disentangled Sparse Representations for Concept-Separated Diffusion Unlearning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:49:01.617230Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.12122"},"observation_digest":"sha256:d9af5d6b1043125bd4bad52652495162b785c1d013692a993ad1aa07a645c487","observation_id":"1fecbe30-0288-4573-b4b9-ffb45395717b","resolution":{"observed_at":"2026-05-13T05:52:22.462659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-14T20:53:40.666929Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:a2797fd0873830ecad54b35b01e01a230498ffad518b8bbef260be0a5df04152","observation_id":"636848fb-09da-4f38-bd53-68091360e0b3","resolution":{"observed_at":"2026-05-14T20:59:28.784575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T04:59:11.877068Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:8495413ce204f3b2e44414807ec48e617557dd16cdbd9c2ba44515a7be99d752","observation_id":"ccd7079f-fd64-42cb-adf8-1bdc9e4c1493","resolution":{"observed_at":"2026-05-15T04:59:45.209373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-20T21:49:47.934339Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:be108c6a3de6e2aa25d3ee7314f8cfd4828aa25d814fab1232e9a3aec3a192f1","observation_id":"601d00b0-efa3-4301-95ad-071b3edf7a0b","resolution":{"observed_at":"2026-05-20T21:53:47.190627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.12874","last_updated":"2026-05-13T01:41:38Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T01:41:38Z","title":"Descriptive Collision in Sparse Autoencoder Auto-Interpretability: When One Explanation Describes Many Features","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:27:38.363693Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.12874"},"observation_digest":"sha256:f270ce761f368a9230a7fa8c09e634736eeb83025a31c260c0546dc702d99c1c","observation_id":"0a3b2eb0-d68d-43ae-a24c-623bd614bbb4","resolution":{"observed_at":"2026-05-14T20:27:58.974178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2605.28149","last_updated":"2026-08-04T06:19:42Z","snapshot_observed_at":"2026-08-07T23:09:28.260788Z","submitted_at":"2026-05-27T08:31:43Z","title":"Sign-Aware Gated Sparse Autoencoders: Modeling Anticorrelated Features with Bi-Jump-ReLU Activations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T14:16:44.232080Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.28149"},"observation_digest":"sha256:5db742702c060b3d16deb662e90416dfea2b772d8f9cdb6b0e24e86c1824278d","observation_id":"11339158-52c7-4c72-86ab-7a76859a9cf6","resolution":{"observed_at":"2026-06-29T14:23:30.750358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-04T05:02:51.330615Z","title":"Sparse autoencoders do not find canonical units of analysis.arXiv preprint arXiv:2502.04878, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28149","last_updated":"2026-08-04T06:19:42Z","snapshot_observed_at":"2026-08-07T23:09:28.260788Z","submitted_at":"2026-05-27T08:31:43Z","title":"Sign-Aware Gated Sparse Autoencoders: Modeling Anticorrelated Features with Bi-Jump-ReLU Activations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T05:02:51.330615Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2605.28149"},"observation_digest":"sha256:fe7b186ec159594a11720fccdb1b5f88e2468a88b64b28fbf0d8299598bbf94e","observation_id":"cd88b479-ee21-454e-8851-c3ec323e2127","resolution":{"observed_at":"2026-08-04T05:02:51.330615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2606.15054","last_updated":"2026-06-29T22:04:02Z","snapshot_observed_at":"2026-08-03T01:16:15.417885Z","submitted_at":"2026-06-13T01:51:05Z","title":"Size Doesn't Matter: Cosine-Scored Sparse Autoencoders","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T07:15:16.674714Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2606.15054"},"observation_digest":"sha256:2a097a372132e301dc208601908bf8bdfca1144c8b5de58a08223fa3617051fb","observation_id":"69602583-7167-40d1-924a-e5a348149c10","resolution":{"observed_at":"2026-07-01T07:15:29.633755Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2606.20347","last_updated":"2026-06-18T15:15:57Z","snapshot_observed_at":"2026-08-03T19:01:38.303561Z","submitted_at":"2026-06-18T15:15:57Z","title":"Critical Percolation as a Synthetic Data Model for Interpretability","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T17:41:29.317167Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2606.20347"},"observation_digest":"sha256:4c69a1ecc921a71106e25e4de99fd9628d7762db44236b1dd2e33349b97b6583","observation_id":"efad8060-df6f-4968-a4f5-5f023a01cae4","resolution":{"observed_at":"2026-07-04T03:49:29.575560Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2606.22994","last_updated":"2026-06-22T08:12:34Z","snapshot_observed_at":"2026-08-08T15:52:49.568637Z","submitted_at":"2026-06-22T08:12:34Z","title":"Do Sparse Autoencoders Learn Meaningful Concept Hierarchies?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T08:46:48.220801Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2606.22994"},"observation_digest":"sha256:d58dfef8de303f5256c8cd15b1ca405c1815c89d3d77c26f17393d92b1157647","observation_id":"cd273a25-47d3-499a-9d18-b24ccc51c51e","resolution":{"observed_at":"2026-07-04T10:29:45.399426Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2606.26396","last_updated":"2026-06-24T21:26:43Z","snapshot_observed_at":"2026-08-02T16:34:16.438122Z","submitted_at":"2026-06-24T21:26:43Z","title":"At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T01:27:39.812228Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2606.26396"},"observation_digest":"sha256:03295e307e65a6ee1ee59918c705f9fa396abb7b78b01ed0f8c965e4a80d4fc1","observation_id":"d75a73d9-4b33-479c-9ca4-50e195db219f","resolution":{"observed_at":"2026-06-26T01:28:50.567880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":"2502.04878","doi":"10.48550/arxiv.2502.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , archivePrefix=","venue":"ArXiv.org","work_id":"0874bbed-5158-4ddd-ab5b-b47713a17812","year":2025},"citing_paper":{"arxiv_id":"2606.32008","last_updated":"2026-06-30T17:43:44Z","snapshot_observed_at":"2026-08-08T09:19:54.150532Z","submitted_at":"2026-06-30T17:43:44Z","title":"Surrogate Fidelity: When Can Open LLMs Explain Closed Ones?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T06:15:42.011563Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2606.32008"},"observation_digest":"sha256:247dd2d1110e0a10fbaa43171c930b23617471b01670324d18f4e88e2b78ef42","observation_id":"51ddf6ad-60a4-4f2e-8637-86b23e9d3cc2","resolution":{"observed_at":"2026-07-01T09:45:40.082546Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04878","snapshot_observed_at":"2026-08-01T23:15:28.686940Z","title":"Sparse autoencoders do not find canonical units of analysis.arXiv preprint arXiv:2502.04878, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15495","last_updated":"2026-07-16T22:54:30Z","snapshot_observed_at":"2026-08-07T08:22:43.917790Z","submitted_at":"2026-07-16T22:54:30Z","title":"Verbalizable Representations Form a Global Workspace in Language Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-01T23:15:28.686940Z"},"links":{"cited_paper":"/paper/2502.04878","citing_paper":"/paper/2607.15495"},"observation_digest":"sha256:5e566a813e65e453ad38775ad44582b51df2ce008c02e53c4f661272f1d54144","observation_id":"322759d2-a828-403a-89b9-196fa3ae6ba1","resolution":{"observed_at":"2026-08-01T23:15:28.686940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04878/citation-record","integrity":"/paper/2502.04878/integrity","json":"/paper/2502.04878/citation-record.json","paper":"/paper/2502.04878"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11944","last_updated":"2024-11-06T22:37:30Z","snapshot_observed_at":"2026-08-04T08:40:10.913790Z","submitted_at":"2024-06-17T17:49:00Z","title":"Transcoders Find Interpretable LLM Feature Circuits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11944","snapshot_observed_at":"2026-08-08T21:12:13.815125Z","title":"Transcoders find interpretable llm feature circuits","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.815125Z"},"links":{"cited_paper":"/paper/2406.11944","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:7eb0a780da1cb474e9e81a6bc38569664e83068f63658e3de6a51836c2956ccd","observation_id":"874c877f-280d-497d-bf95-e3984e979e07","resolution":{"observed_at":"2026-08-08T21:12:13.815125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-08T21:12:13.828320Z","title":"Scaling and evaluating sparse autoencoders.arXiv preprint arXiv:2406.04093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.828320Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:020e3305597f18a80629c4a80d46329f23d9c175b992921522d7805aef0f4958","observation_id":"239891e1-7ec4-42f5-adef-30863cf8261e","resolution":{"observed_at":"2026-08-08T21:12:13.828320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14767","last_updated":"2023-10-13T19:01:20Z","snapshot_observed_at":"2026-08-08T04:09:02.821651Z","submitted_at":"2023-04-28T11:26:17Z","title":"Dissecting Recall of Factual Associations in Auto-Regressive Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14767","snapshot_observed_at":"2026-08-08T21:12:13.831971Z","title":"Dissecting recall of factual associations in auto-regressive language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.831971Z"},"links":{"cited_paper":"/paper/2304.14767","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:a18c06f22023001304e128ca0457f5dfd9883f8c5d0f753354a9cb2152885a06","observation_id":"1d22a8e1-406f-4e90-b0c1-ff1f72e12c7a","resolution":{"observed_at":"2026-08-08T21:12:13.831971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02207","last_updated":"2024-03-04T18:25:29Z","snapshot_observed_at":"2026-08-06T19:42:39.893943Z","submitted_at":"2023-10-03T17:06:52Z","title":"Language Models Represent Space and Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02207","snapshot_observed_at":"2026-08-08T21:12:13.835885Z","title":"Language models represent space and time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.835885Z"},"links":{"cited_paper":"/paper/2310.02207","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:501dbf6d977edfb8ec30e1f06af95a5e4a37ba089ef3487272900c8285972c1f","observation_id":"42ee1fd8-7de2-4baf-b442-6783740ff9ee","resolution":{"observed_at":"2026-08-08T21:12:13.835885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17759","last_updated":"2024-06-25T17:43:13Z","snapshot_observed_at":"2026-08-07T12:13:26.335194Z","submitted_at":"2024-06-25T17:43:13Z","title":"Interpreting Attention Layer Outputs with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17759","snapshot_observed_at":"2026-08-08T21:12:13.839743Z","title":"In- terpreting attention layer outputs with sparse autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.839743Z"},"links":{"cited_paper":"/paper/2406.17759","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:1835cfc7d7bf99b9152cda3ad50ee008e4e17d3bfac0d88f3467302e2e60f816","observation_id":"3f60d5c5-bb85-431f-a961-bef702da7580","resolution":{"observed_at":"2026-08-08T21:12:13.839743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-08T21:12:13.846998Z","title":"Johnny Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.846998Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:4f864d6010e30139ca392d491f09db41306af83cf4b9f81982856b79a28e6ed0","observation_id":"3815e31b-4fd3-4f2d-84e6-28efbfb6b15c","resolution":{"observed_at":"2026-08-08T21:12:13.846998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08366","last_updated":"2024-05-20T17:46:14Z","snapshot_observed_at":"2026-08-09T11:11:42.037270Z","submitted_at":"2024-05-14T07:07:13Z","title":"Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08366","snapshot_observed_at":"2026-08-08T21:12:13.850571Z","title":"Software available from neuronpedia.org","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.850571Z"},"links":{"cited_paper":"/paper/2405.08366","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:a96d35c66f682f2d44f44969b070080c257073ba51ad1de6c83aed1a514fcc29","observation_id":"bc6ddbfc-4f97-4441-a16a-813e4a5fcc4a","resolution":{"observed_at":"2026-08-08T21:12:13.850571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.227815Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"865e1ff1-3fb3-41b2-ba3b-eecebcd00887","year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.858232Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:2423b003bfc0c9bfc7997813bf5aa6ac4efbef843c6f8bf8392b6547b1686a64","observation_id":"d9ba40f5-e078-4ae5-a2de-b448ab61c189","resolution":{"observed_at":"2026-08-08T21:12:14.231281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-08T21:12:13.861544Z","title":"Progress measures for grokking via mechanistic interpretability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.861544Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:d173aaa85fc037653beeea74b2b7523af29ae6c982417968adf39486c73c31fc","observation_id":"2e5bcfbd-e44b-40ce-8d4d-92ad719e56e0","resolution":{"observed_at":"2026-08-08T21:12:13.861544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.162659Z","title":"However, in practice we find that the bdecs of SAEs trained on the same latents are very similar (minimum cosine similarity of 0.9970, differing by less than 0.1% in magnitude)","venue":null,"work_id":"35823b65-272c-46e3-acdd-eac60427b776","year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.904239Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:5dba36fee6f50cfc2b6edbb4d25e7fde0559d3a9353637579829c20ec6279a1a","observation_id":"49d29ef5-c3b9-4962-a2b7-4dcc3cb0f65e","resolution":{"observed_at":"2026-08-08T21:12:14.167020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-08T21:12:13.874504Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.874504Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:f553d4c8426e78633a8f74288f826d4be0444d0d0e1a016bb467f858e20d3f2c","observation_id":"ef503a3c-c93f-4473-9a87-b88950e81bfc","resolution":{"observed_at":"2026-08-08T21:12:13.874504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-08T21:12:13.878104Z","title":"Inter- pretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.878104Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:f9debe3531251f92d3d0505e16b1e6b515f55926d0c4d412a8f90205dac498b5","observation_id":"2ab72c83-bf32-4747-89cd-887135d947a0","resolution":{"observed_at":"2026-08-08T21:12:13.878104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14662","last_updated":"2024-07-19T20:50:57Z","snapshot_observed_at":"2026-08-04T20:30:17.566298Z","submitted_at":"2024-07-19T20:50:57Z","title":"Relational Composition in Neural Networks: A Survey and Call to Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14662","snapshot_observed_at":"2026-08-08T21:12:13.881826Z","title":"Relational composition in neural networks: A survey and call to action","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.881826Z"},"links":{"cited_paper":"/paper/2407.14662","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:c77ba09f99c8399d64d0ac1a6d83ca93c4b5e653acb05778204df36f3baaaef8","observation_id":"6e21bddf-f330-44fe-8cb8-15dc0fc2d78f","resolution":{"observed_at":"2026-08-08T21:12:13.881826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.218071Z","title":"Typically measured as average L0 across a batch: L0 = 1 n P i ∥f (xi)∥0","venue":null,"work_id":"8e8f7cb0-6eca-4932-984c-6b3c4cd2aeb0","year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.886122Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:56afa2cdb2a857cef3373d8c832256af0b48847b75866bf8db59f4f6c412ecef","observation_id":"2703105c-501b-43ed-8254-cd148002a0e0","resolution":{"observed_at":"2026-08-08T21:12:14.221640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.207740Z","title":"This provides a gradient for training unlike the L0-norm, but suppresses latent activations harming reconstruction performance (Rajamanoharan et al., 2024a)","venue":null,"work_id":"1eaa3144-954f-4014-af37-f3f656f0ad8e","year":2023},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.889911Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:85fc89aab135d890bbc0a66e0b8f04d4d44b016b2e83673d386d40bada8c10c4","observation_id":"6b01bdb2-aa42-4233-967c-8e11c63c0211","resolution":{"observed_at":"2026-08-08T21:12:14.211419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.197357Z","title":"make sure","venue":null,"work_id":"5d16e766-b3d8-467c-b65e-37292fb177c3","year":2024},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.894210Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:ba5fb591a44fac84669f8a1e549028d65d6a292df5b2a63e388d0a6fe019c13d","observation_id":"75b836a2-3e6f-43ba-81ea-97bafebf99b6","resolution":{"observed_at":"2026-08-08T21:12:14.200710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.185985Z","title":"A.5 O PEN SOURCE SAE WEIGHTS All GPT-2 Small SAEs were trained on the layer 8 residual stream, which was chosen in line with Gao et al","venue":null,"work_id":"eabdd21b-ac02-4440-b2b6-236580965f07","year":2024},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.897659Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:a2ffb57a4162c1cd97e02f0ab6eeaff12102c9a7151be4ad00f663dc9cd8123b","observation_id":"5b66ee5d-585e-48f4-ad4c-3bbdc2b858b6","resolution":{"observed_at":"2026-08-08T21:12:14.190068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.174089Z","title":"We used the TransformerLens ( https://transformerlensorg.github.io/ TransformerLens/) implementations of GPT-2 and Gemma 2 2B","venue":null,"work_id":"1c917a75-6a84-4d68-9564-d71f85429fb0","year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.900977Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:65eb6ecac52c071bfe78e482e9b62f55d65dd2558747b776021d538c732181ec","observation_id":"192fd351-476e-47c5-9b4c-101350f33c37","resolution":{"observed_at":"2026-08-08T21:12:14.178619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.141464Z","title":null,"venue":null,"work_id":"a8c9cf9c-8827-4586-9421-acdd500a948f","year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.911100Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:d05ef17fb6b153bef42ac4faec6dadb91980d813f009ab5926f383feec4b165d","observation_id":"4033a41d-75f9-4879-bd62-79ba8f998c96","resolution":{"observed_at":"2026-08-08T21:12:14.145630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.130085Z","title":"Figure 21: Sparse probing evaluation accuracy by GPT-2 SAE dictionary size across 8 benchmark datasets, with a sparse probe using the top latent","venue":null,"work_id":"fb6829be-9820-4ea8-bc12-8ce024416422","year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.914285Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:acc396cea779f961a55c3569b0baf1f41cb40190d9365103575ab162e6eb7dc6","observation_id":"730dedff-5172-4142-a060-29ca0ecbe48a","resolution":{"observed_at":"2026-08-08T21:12:14.134374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.115678Z","title":"22 Published as a conference paper at ICLR 2025 Figure 23: TPP evaluation accuracy by GPT-2 SAE dictionary size across 2 benchmark datasets, ablating up to 50 latents","venue":null,"work_id":"1f0478f0-ab1f-4442-bfee-0322cd52ce22","year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.917656Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:56fc6d44b29778bf7906b7b891399d03e4b2f0b1ce8d180e1d2ec955d459a017","observation_id":"9bf66e8c-47ce-4693-8b75-852b380bbea2","resolution":{"observed_at":"2026-08-08T21:12:14.122464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:14.152340Z","title":"We find a lower threshold for distinguishing novel features from reconstruction features (0.4)","venue":null,"work_id":"ef21ee02-37a6-4e4d-ac40-9f07e8c6464f","year":2024},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.907579Z"},"links":{"citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:351b8def7c0e250051274ba7160ec2d4b5097043172befa2a1cc9e38dc0683e4","observation_id":"77c682d5-d3a9-459b-8f49-dee665636ed8","resolution":{"observed_at":"2026-08-08T21:12:14.156015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-08T21:12:13.865814Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.865814Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:03e57c53fdaa33b1e49d883485914474ea5fe567d52e952cb9565b4dc177e413","observation_id":"78cdf7f9-3d16-4384-ac2e-7458f9175793","resolution":{"observed_at":"2026-08-08T21:12:13.865814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5663","last_updated":"2014-03-22T17:12:07Z","snapshot_observed_at":"2026-08-01T16:20:01.675800Z","submitted_at":"2013-12-19T17:46:46Z","title":"k-Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5663","snapshot_observed_at":"2026-08-08T21:12:13.854776Z","title":"Samuel Marks, Can Rager, Eric J Michaud, Yonatan Belinkov, David Bau, and Aaron Mueller","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.854776Z"},"links":{"cited_paper":"/paper/1312.5663","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:812bbaf804416ae7486f7d71b07757ab3551ace63a86f5d79622e1b1904f7223","observation_id":"11610842-c7ca-4265-99e0-90cde01e776d","resolution":{"observed_at":"2026-08-08T21:12:13.854776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13382","last_updated":"2024-06-26T14:27:49Z","snapshot_observed_at":"2026-08-09T03:25:38.596456Z","submitted_at":"2022-10-24T16:29:55Z","title":"Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13382","snapshot_observed_at":"2026-08-08T21:12:13.843304Z","title":"Emergent world representations: Exploring a sequence model trained on a synthetic task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.843304Z"},"links":{"cited_paper":"/paper/2210.13382","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:46acdf98295433799811a8c6a4a3c8bb1a029c5e4e848569ee99c61c20dcad7b","observation_id":"d5f1cc76-a6a5-46fd-b5e3-13ef2965bb31","resolution":{"observed_at":"2026-08-08T21:12:13.843304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16014","last_updated":"2024-04-30T17:54:04Z","snapshot_observed_at":"2026-08-02T10:59:21.418230Z","submitted_at":"2024-04-24T17:47:22Z","title":"Improving Dictionary Learning with Gated Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16014","snapshot_observed_at":"2026-08-08T21:12:13.870041Z","title":"Improving dictionary learning with gated sparse autoen- coders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.870041Z"},"links":{"cited_paper":"/paper/2404.16014","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:b96878f22266973a091d652859dcf2725136f9cde404c9c5c2f5cd5ff3002929","observation_id":"409d70f5-73cc-4304-8ba0-9bde432a44d0","resolution":{"observed_at":"2026-08-08T21:12:13.870041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-08T21:12:13.820172Z","title":"Nelson Elhage, Tristan Hume, Catherine Olsson, Nicholas Schiefer, Tom Henighan, Shauna Kravec, Zac Hatfield-Dodds, Robert Lasenby, Dawn Drain, Carol Chen, et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.820172Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:659339bdd626565a2cf6e7412ddd0f457ebb7ab988fab3604d38afb99381df8b","observation_id":"05650c7c-ca77-4ece-abde-b43b5a1f9dd9","resolution":{"observed_at":"2026-08-08T21:12:13.820172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14860","last_updated":"2025-02-27T03:03:59Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:59:04Z","title":"Not All Language Model Features Are One-Dimensionally Linear","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14860","snapshot_observed_at":"2026-08-08T21:12:13.824293Z","title":"Not all language model features are linear","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.824293Z"},"links":{"cited_paper":"/paper/2405.14860","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:91f96bf31f69c6d76c64d4cff4d6ff790eb446d8502d30c2bda40cc9e67baac3","observation_id":"53139257-4cc2-4178-a89a-e7ad60874756","resolution":{"observed_at":"2026-08-08T21:12:13.824293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06410","last_updated":"2024-12-09T11:39:00Z","snapshot_observed_at":"2026-08-01T21:49:25.316353Z","submitted_at":"2024-12-09T11:39:00Z","title":"BatchTopK Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06410","snapshot_observed_at":"2026-08-08T21:12:13.806500Z","title":"Batchtopk sparse autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.806500Z"},"links":{"cited_paper":"/paper/2412.06410","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:4792ba6c2d3d728160ba0cc03d330045ea3d668b0d750c5433f6ae7fd39e70a9","observation_id":"5fe28006-0be0-4138-b8f7-57db0079805f","resolution":{"observed_at":"2026-08-08T21:12:13.806500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-08T21:12:13.811079Z","title":"Sparse autoen- coders find highly interpretable features in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:13.811079Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2502.04878"},"observation_digest":"sha256:2215963d8d41cf0c48ee0b036643b3ebc8e26850daf861caeaebcc32dd209557","observation_id":"d0916881-ecaa-4c01-bb3a-c50a8aa1698f","resolution":{"observed_at":"2026-08-08T21:12:13.811079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04878","last_updated":"2025-02-07T12:33:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T03:25:58.789782Z","submitted_at":"2025-02-07T12:33:08Z","title":"Sparse Autoencoders Do Not Find Canonical Units of Analysis"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 23 inbound Pith citation observations for arXiv:2502.04878."}