{"as_of":"2026-08-10T08:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bbb8ce8734b6b0b04737b06543e1ee01246fc6a8e83fcd56ca18fd011b9c85d","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:31:18.269637Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:11:43.051506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:35:51.305374Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2510.23912","last_updated":"2026-04-23T06:11:56Z","snapshot_observed_at":"2026-08-04T11:05:56.199122Z","submitted_at":"2025-10-27T22:39:34Z","title":"Key and Value Weights Are Probably All You Need: On the Necessity of the Query, Key, Value weight Triplet in Self-Attention Transformers","version":7},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T03:38:36.932424Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2510.23912"},"observation_digest":"sha256:15acd849456c08fcc9b9cafab65ec1a55312e67ee31df0cffe36d20292bce2a0","observation_id":"c1b618d1-fb46-4671-98c7-5601df990771","resolution":{"observed_at":"2026-05-18T03:40:50.558061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-08-03T03:11:43.051506Z","title":"io/Inverse_Tracr.pdf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08857","last_updated":"2026-06-05T13:59:44Z","snapshot_observed_at":"2026-08-06T16:49:20.566067Z","submitted_at":"2026-02-09T16:22:29Z","title":"Discovering Interpretable Algorithms by Decompiling Transformers to RASP","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:11:43.051506Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2602.08857"},"observation_digest":"sha256:b74757aa9f8f001c9daf3b46f3332608548d23440efb1236667d0a20de0feedf","observation_id":"84b8c5e9-ed7f-4d58-a553-8e19648e3cd2","resolution":{"observed_at":"2026-08-03T03:11:43.051506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2602.10408","last_updated":"2026-05-19T21:29:01Z","snapshot_observed_at":"2026-08-01T12:13:46.685645Z","submitted_at":"2026-02-11T01:40:34Z","title":"Gated Normalization Removal and Scale Anchoring in Pre-Norm Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T14:19:46.400753Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2602.10408"},"observation_digest":"sha256:e42799caeb7948c0b8e8c1c30a12ec75aa142c427a66a7549037fb983004dbd8","observation_id":"23ef7d84-e166-4f62-8de0-541ef57c2998","resolution":{"observed_at":"2026-05-21T14:20:13.540889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2604.07098","last_updated":"2026-05-11T15:12:11Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T13:51:07Z","title":"Selective Neuron Amplification in Transformer Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:31:17.182481Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2604.07098"},"observation_digest":"sha256:674ff8060a519d01c8efdb5b74f7203dd80828a56bbc713f0f8aad77d50a6c69","observation_id":"5ac88c08-06e6-441e-ba65-605d304cf889","resolution":{"observed_at":"2026-05-11T00:25:52.362679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2604.07098","last_updated":"2026-05-11T15:12:11Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T13:51:07Z","title":"Selective Neuron Amplification in Transformer Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:28:05.507808Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2604.07098"},"observation_digest":"sha256:d99dc80f7c8f029204d4502f65f580319eac2d3bfe79042c65615012961b8236","observation_id":"42cc7a73-a64c-458f-9f99-2e469bff0c8f","resolution":{"observed_at":"2026-05-12T06:16:25.133581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2605.24033","last_updated":"2026-07-29T02:27:43Z","snapshot_observed_at":"2026-08-02T13:29:53.230695Z","submitted_at":"2026-05-21T05:21:40Z","title":"Towards Verifiable Transformers: Solver-Checkable Circuit Explanations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:47:13.178911Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2605.24033"},"observation_digest":"sha256:2ebdd06159124601f0cd464a1bd7f84385617fe44c7302e5269c9a3b15f8de52","observation_id":"a0fa120d-8d23-4b81-b0b6-15533262c7e2","resolution":{"observed_at":"2026-07-01T15:05:48.064804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-08-02T13:29:53.932972Z","title":"Transformers Don’t Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.24033","last_updated":"2026-07-29T02:27:43Z","snapshot_observed_at":"2026-08-02T13:29:53.230695Z","submitted_at":"2026-05-21T05:21:40Z","title":"Towards Verifiable Transformers: Solver-Checkable Circuit Explanations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T13:29:53.932972Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2605.24033"},"observation_digest":"sha256:d00d733c38b9c691ef421f974136ecfc73c99840d0bb30b2150bffe28357ce54","observation_id":"b342e9cf-cb1f-4e01-bfaa-8a2cddd8a182","resolution":{"observed_at":"2026-08-02T13:29:53.932972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-29T03:35:34.594617Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:2e7d941ae69a108837e4b46d44128394b3da9525a57e5c410f14172781259c97","observation_id":"a357d3c0-3e46-4594-874e-a9d86d4d0a92","resolution":{"observed_at":"2026-07-01T17:35:51.306825Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":"2507.02559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02559","snapshot_observed_at":"2026-07-01T17:35:51.305374Z","title":"Brock, A., De, S., Smith, S","venue":null,"work_id":"fc8b84bb-a90b-47b5-91a8-3ed1d8027bbe","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-30T09:32:59.824110Z"},"links":{"cited_paper":"/paper/2507.02559","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:a418be27b2759b30d2f4a6f3d0025e9ee8009b8a73c0e852ce810d3bbae62b75","observation_id":"7dc6d4e6-4bc0-4830-a4e2-274b3eaefe57","resolution":{"observed_at":"2026-06-30T09:34:34.461654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02559/citation-record","integrity":"/paper/2507.02559/integrity","json":"/paper/2507.02559/citation-record.json","paper":"/paper/2507.02559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.056089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.056089Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:f0722eb3555b017cf34a1771bf03b2b21da3b6f82725b8e17277bf85cce23250","observation_id":"c869a743-df52-4b73-b291-c0d95f896c6b","resolution":{"observed_at":"2026-08-06T20:31:15.056089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.172686Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.172686Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:057725cee871096e8d4dc9be4e783a17c951d84ccff3e6a391c9ed7cb7b44686","observation_id":"c0c8e58f-c08b-40df-acbc-810dffbea027","resolution":{"observed_at":"2026-08-06T20:31:15.172686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02732","last_updated":"2025-08-05T16:43:21Z","snapshot_observed_at":"2026-08-08T16:05:45.479083Z","submitted_at":"2025-04-03T16:17:55Z","title":"Why do LLMs attend to the first token?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02732","snapshot_observed_at":"2026-08-06T20:31:15.257797Z","title":"Why do LLMs attend to the first token? arXiv preprint arXiv:2504.02732, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.257797Z"},"links":{"cited_paper":"/paper/2504.02732","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:63b1b79460e84513a3a0aa5d603d9b52e1609c40656ad89163d7e696bef45854","observation_id":"e041b568-94b6-450a-a69f-aece269aa919","resolution":{"observed_at":"2026-08-06T20:31:15.257797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.344778Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.344778Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:0f81ea7974b9f78a0965502446eb5814aa96bb56f5f18cc89d714b39ed4126d7","observation_id":"11fdb6d2-f6eb-4844-bea2-6740f89faba2","resolution":{"observed_at":"2026-08-06T20:31:15.344778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10928","last_updated":"2024-05-20T16:34:37Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:27:19Z","title":"The Local Interaction Basis: Identifying Computationally-Relevant and Sparsely Interacting Features in Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10928","snapshot_observed_at":"2026-08-06T20:31:15.407102Z","title":"a nni, Avery Griffin, J \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.407102Z"},"links":{"cited_paper":"/paper/2405.10928","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d7462657d972c27cf1d27b90c73f63121d1a152bc5c5a04049e26293e8ec4ca6","observation_id":"dde8764f-8c93-4737-b02f-420c9baa97b3","resolution":{"observed_at":"2026-08-06T20:31:15.407102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.553041Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.553041Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d2a49fbc35283ddf31ba6b83b3569231540dff3a8409df9913e4715781a4599e","observation_id":"42a3c983-8edd-4529-9f24-b064e7bff7fc","resolution":{"observed_at":"2026-08-06T20:31:15.553041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18147","last_updated":"2025-06-06T11:10:03Z","snapshot_observed_at":"2026-08-09T11:08:51.703405Z","submitted_at":"2025-02-25T12:21:45Z","title":"Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18147","snapshot_observed_at":"2026-08-06T20:31:15.674321Z","title":"Jacobian sparse autoencoders: Sparsify computations, not just activations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.674321Z"},"links":{"cited_paper":"/paper/2502.18147","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:17dc26a8a2a5f872dbde4e0044efd59cb5ba935b91424bf00ec222c67dbf2bff","observation_id":"e68b7bf3-5b83-4e2e-bd7f-67b328e240c4","resolution":{"observed_at":"2026-08-06T20:31:15.674321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-06T20:31:15.779455Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.779455Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:c723339ce832b02203e0cf594778f2da7638a06f50908162e1cb59be955a9ad0","observation_id":"d20ea447-be10-4c78-90b7-ed412a0a938a","resolution":{"observed_at":"2026-08-06T20:31:15.779455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:15.884759Z","title":"Finding alignments between interpretable causal variables and distributed neural representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.884759Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:2b37584136f914bdf22ae8a519560f204c2f3567617a08309978fec8c4af19c6","observation_id":"798e706f-9568-4c43-9375-68cdc5b1949b","resolution":{"observed_at":"2026-08-06T20:31:15.884759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T20:31:15.963355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:15.963355Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:844547c7c3adc2de35bd9faa7b64168d7440f8bd2a043a5119923275f20bc2b5","observation_id":"e73c837d-6e25-471b-a3a7-fab05156562f","resolution":{"observed_at":"2026-08-06T20:31:15.963355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:16.060049Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.060049Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:2f42002de7f93b162374ca19d995d9f3e9ffa3244312b3ac4e72438ca93bc97b","observation_id":"fb4e697c-81f2-4f85-a760-a354b24aa4d9","resolution":{"observed_at":"2026-08-06T20:31:16.060049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:21.669980Z","title":"Geometric interpretation of layer normalization and a comparative analysis with rmsnorm, 2025","venue":null,"work_id":"8c37a3b3-dc77-4bce-9c66-1aa80bf6ca4c","year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.177715Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d79c86790fe61ea39dc26ad8e34c6895d8f4b23cc970ac84d6eae111970f9071","observation_id":"111d19bb-32ae-4288-b298-63ef7fc93219","resolution":{"observed_at":"2026-08-06T20:31:21.767788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:21.560477Z","title":"Universal neurons in gpt2 language models","venue":null,"work_id":"35551d6c-0412-4eab-9c87-371467fe827d","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.231561Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:770774ac2c93ccaeaec85ce1939e1c47f84a21fe7ab4ada54f01f5df7513b5c7","observation_id":"7239c004-3271-4d79-b952-90e028f687bd","resolution":{"observed_at":"2026-08-06T20:31:21.597286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:21.250832Z","title":"You can remove gpt2's LayerNorm by fine-tuning","venue":null,"work_id":"ebcfd87b-5eb5-4238-9453-67e7ade75e72","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.288441Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:3c883d7998ec2755633724a2e2fd84e4135221adf3696d1ce8c81e85faec4a84","observation_id":"99434904-f61f-4b34-a984-1539183175a3","resolution":{"observed_at":"2026-08-06T20:31:21.426689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15255","last_updated":"2024-04-23T17:42:29Z","snapshot_observed_at":"2026-07-31T21:25:53.647335Z","submitted_at":"2024-04-23T17:42:29Z","title":"How to use and interpret activation patching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15255","snapshot_observed_at":"2026-08-06T20:31:16.371013Z","title":"How to use and interpret activation patching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.371013Z"},"links":{"cited_paper":"/paper/2404.15255","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:7bae03134e9e1efc9589f9cb631ded7647cb7a55f7cf2c8757e3518010d5f265","observation_id":"fe9d0fef-a56e-4bdb-be57-c2ff16090900","resolution":{"observed_at":"2026-08-06T20:31:16.371013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.959429Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":"eb8f81fb-294a-463c-b695-a694721cd2a9","year":2015},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.500310Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:978a05e3ed2e72b4fa0c7f6044666e4014a2ae0bbb8de8a7fbf897cec74fa896","observation_id":"b1b3b626-81be-4d72-90fb-0700bf0324e7","resolution":{"observed_at":"2026-08-06T20:31:21.086538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.705693Z","title":"Visit: Visualizing and interpreting the semantic information flow of transformers","venue":null,"work_id":"009ed894-4f04-4f33-8cb9-fcddfa63c160","year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.581740Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:29c8ffdda3947b98a726fed9aa3dde1e5367adf2a76c821642408ae9eebe2e73","observation_id":"d04f406e-d069-4c5b-9e81-7b1851e40253","resolution":{"observed_at":"2026-08-06T20:31:20.802792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.516107Z","title":"Sparse autoencoders work on attention layer outputs, Jan 2024","venue":null,"work_id":"f8fa3231-8524-4a1b-a65f-40614b711990","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.661983Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:0721d237195ae93072c069a64ab94a9884e93359a4070a00ce3534e6f2333b7b","observation_id":"a35f9380-5228-4bcf-a980-eda9ca20e0e7","resolution":{"observed_at":"2026-08-06T20:31:20.597517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:16.726988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.726988Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:f6942d795e73fde6fb809aef78c9308d8926499c2f44dced72cc5243146477f6","observation_id":"2c399d03-4f48-4f46-bda9-872795db513b","resolution":{"observed_at":"2026-08-06T20:31:16.726988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-06T20:31:16.822219Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.822219Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:6c9a11eb978e7987e5705d09a9f8ca82f254d0383e77c1513d24b5d52af55c1f","observation_id":"546eccdf-40c9-4f50-8908-d8228a2951a3","resolution":{"observed_at":"2026-08-06T20:31:16.822219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04625","last_updated":"2023-10-06T23:37:24Z","snapshot_observed_at":"2026-08-09T04:15:15.554561Z","submitted_at":"2023-10-06T23:37:24Z","title":"Copy Suppression: Comprehensively Understanding an Attention Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04625","snapshot_observed_at":"2026-08-06T20:31:16.921232Z","title":"Copy Suppression: Comprehensively Understanding an Attention Head","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:16.921232Z"},"links":{"cited_paper":"/paper/2310.04625","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:18794b8600be639a5d14a537dcf5eb042ebffaf429c60add2333e5b385102cf7","observation_id":"d07e6a75-ee99-41cb-86a3-0bb1d54231b9","resolution":{"observed_at":"2026-08-06T20:31:16.921232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-07-06T12:36:34.388460Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-06T20:31:17.012912Z","title":"Locating and editing factual associations in GPT","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.012912Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:f07ad76dbef26595c65168ab64bfc6bfc53a5eaedec680d196720236a8ed186f","observation_id":"b3392b0e-1386-4c5d-8410-29acc96e6ab1","resolution":{"observed_at":"2026-08-06T20:31:17.012912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.435257Z","title":"Tinymodel: A tinystories lm with saes and transcoders, 2024","venue":null,"work_id":"f6356352-6fa3-4bc5-b06f-afe49309be4f","year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.087598Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:cf66520cb4ea1c5b2f6ae9b2f41116650a8aa403144a276659422fbef39a72ea","observation_id":"9be48507-3147-49c3-8d30-9f26f23fa5fe","resolution":{"observed_at":"2026-08-06T20:31:20.467692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.309895Z","title":"Attribution patching: Activation patching at industrial scale, Mar 2023 a","venue":null,"work_id":"ff2f04f1-aa05-4131-a823-e0669a18f593","year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.142216Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:175d2612a8acecc855ffd778a94710b684e7efc498291a01f49340e321a1b501","observation_id":"aa89992e-cd0f-4ba6-8fe5-32689f46f113","resolution":{"observed_at":"2026-08-06T20:31:20.385237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.181656Z","title":"Exploratory analysis demo (transformerlens)","venue":null,"work_id":"7f1e1b0d-0742-46c8-bf87-168a24a919e9","year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.226190Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d141542a8cd6408aa04ed45d703e151dbf3f9162dae3a89e3c7e3f2e9a0e1d4c","observation_id":"4c84a2a1-d6f1-4065-82e7-f136d1c90939","resolution":{"observed_at":"2026-08-06T20:31:20.225301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:17.293516Z","title":"Transformerlens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.293516Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:7a847e372571d49041b003706215e545efb155725891045a73d231cf3aa3fb86","observation_id":"1dd69c8d-38aa-4cca-8965-b2d0889424cd","resolution":{"observed_at":"2026-08-06T20:31:17.293516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:20.030702Z","title":"interpreting gpt: the logit lens, Aug 2020","venue":null,"work_id":"cafcc74e-856c-48f7-bfe1-ece10f7d6ce7","year":2020},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.362337Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:6b6b6b1ee8a2cd4b9614da005cd48ef05a84069824cbed4b0881218c877cb638","observation_id":"f971a940-3747-46ba-bae3-76ae16767369","resolution":{"observed_at":"2026-08-06T20:31:20.082358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:17.418514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.418514Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d04aafbee00891183e4f2edb0c35e30ca4052dc451f69dbb1bfed0379aa18cd6","observation_id":"e749d544-cfd0-4e1b-9617-f80df5827e35","resolution":{"observed_at":"2026-08-06T20:31:17.418514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:19.246209Z","title":"Direct and indirect effects","venue":null,"work_id":"9ed7996f-357f-410d-8b56-509d557d6ba8","year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.474033Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:e9c3633860ba807cc2d800083a5b2c0c74f55ba44b08197004bc754ee1af102f","observation_id":"4ddc0416-7fcc-431f-8e6a-17f5efd33b43","resolution":{"observed_at":"2026-08-06T20:31:19.538617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16254","last_updated":"2024-11-08T12:54:16Z","snapshot_observed_at":"2026-08-04T15:45:35.991489Z","submitted_at":"2024-06-24T01:31:03Z","title":"Confidence Regulation Neurons in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16254","snapshot_observed_at":"2026-08-06T20:31:17.531668Z","title":"Confidence regulation neurons in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.531668Z"},"links":{"cited_paper":"/paper/2406.16254","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:4909349498e9651a1fdc9d48759c62397b61b0e1043df112e29a669000fb7590","observation_id":"9a41a79c-d3f2-494b-bef6-e251be332513","resolution":{"observed_at":"2026-08-06T20:31:17.531668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:31:17.573752Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.573752Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:e647720714f5a31827dd8a52432331790ef4147cb780d04a05324aecabedc5cd","observation_id":"f1e544b0-9800-4f08-b4d3-7f091708f47a","resolution":{"observed_at":"2026-08-06T20:31:17.573752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:17.639147Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.639147Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:bab739a40f1a89c13af4c1c820f971d68b4c78fccbdd26c7a24901acaf2727fb","observation_id":"9a14a053-66b1-48d6-9c44-fe69d155270f","resolution":{"observed_at":"2026-08-06T20:31:17.639147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.979032Z","title":"Understanding the failure of batch normalization for transformers in nlp","venue":null,"work_id":"00d41469-1874-44e9-b250-c3e96b65632b","year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.702651Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:55cbac8f623dd214a3f0a35a6ea8212bf6e4a8873b07f7844364425813c5caf9","observation_id":"2c55ad8d-8a26-4887-b6e2-0b7c0c681830","resolution":{"observed_at":"2026-08-06T20:31:19.058706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T20:31:17.798498Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.798498Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:566bd2fdff6564f20120f496f27e9a5df6da1613b409c5007888af3db5f5c9a4","observation_id":"a1e61622-ebda-4274-882d-000351d125d4","resolution":{"observed_at":"2026-08-06T20:31:17.798498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.760648Z","title":"Re-examining layernorm","venue":null,"work_id":"cd59827a-addd-4485-9a52-04c474ef55d8","year":2022},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.865032Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:acef330b0001c026024932ec732ef71bec91f089f08c0158792ec38f602633db","observation_id":"51304b89-5000-4a5d-90fe-45a9839812db","resolution":{"observed_at":"2026-08-06T20:31:18.869243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T20:31:17.953864Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:17.953864Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:f17e992df42625145bfd88216dd46131757d0ac1eb053b4803804a78db449eba","observation_id":"36a28ddc-1ade-4255-aca7-410308e28a62","resolution":{"observed_at":"2026-08-06T20:31:17.953864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08908","last_updated":"2025-03-11T21:40:58Z","snapshot_observed_at":"2026-08-07T17:11:42.101660Z","submitted_at":"2025-03-11T21:40:58Z","title":"Interpreting the Repeated Token Phenomenon in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08908","snapshot_observed_at":"2026-08-06T20:31:18.044410Z","title":"Interpreting the repeated token phenomenon in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.044410Z"},"links":{"cited_paper":"/paper/2503.08908","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:d70c3dcfc2433db4fe3d2a93fbdadefc382257679463adfc04096a5cec42332e","observation_id":"0e012156-7341-48ac-9b01-fb96607b4c76","resolution":{"observed_at":"2026-08-06T20:31:18.044410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.138243Z","title":"Root mean square layer normalization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.138243Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:939be63f8c488e05a6d5ca58a05b2c2b3fc575e8f13fff165bbc572e52678754","observation_id":"44f04f6d-ef34-414e-be54-aa848e4d1365","resolution":{"observed_at":"2026-08-06T20:31:18.138243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16042","last_updated":"2024-01-17T04:07:06Z","snapshot_observed_at":"2026-08-08T04:58:14.317234Z","submitted_at":"2023-09-27T21:53:56Z","title":"Towards Best Practices of Activation Patching in Language Models: Metrics and Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16042","snapshot_observed_at":"2026-08-06T20:31:18.203317Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.203317Z"},"links":{"cited_paper":"/paper/2309.16042","citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:076f5b9b97007b609acbe25248b01540b40e9dc0b8b46db3ccdfd6784d885ee0","observation_id":"d1634cc7-c2df-4015-bd8e-792616b6dc9b","resolution":{"observed_at":"2026-08-06T20:31:18.203317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:31:18.606501Z","title":"Transformers without normalization, 2025","venue":null,"work_id":"0593e5d5-246c-4d54-9fac-d845687d062a","year":2025},"citing_paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:18.269637Z"},"links":{"citing_paper":"/paper/2507.02559"},"observation_digest":"sha256:5d0ff6945b087b69dbda76100c6381008d42d7dfb314ca86ad87abc1f7544c3a","observation_id":"f9d3462e-56da-4ec7-8cf4-b8fc3231803d","resolution":{"observed_at":"2026-08-06T20:31:18.679971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02559","last_updated":"2025-07-03T12:09:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:10:36.310582Z","submitted_at":"2025-07-03T12:09:04Z","title":"Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 9 inbound Pith citation observations for arXiv:2507.02559."}