{"as_of":"2026-08-16T15:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6b1fb210f917a9d85f029f52c6da0542bf4ce99591707be002748742d498810","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:21:13.021612Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:23:50.436202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"cited_work":{"arxiv_id":"2507.22928","doi":"10.48550/arxiv.2507.22928","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2507.22928 , year=","venue":"ArXiv.org","work_id":"6b0774d2-1143-4bcb-8eae-f4b37a01dfa3","year":null},"citing_paper":{"arxiv_id":"2606.06188","last_updated":"2026-06-04T13:59:07Z","snapshot_observed_at":"2026-08-12T18:10:57.145738Z","submitted_at":"2026-06-04T13:59:07Z","title":"The Tell-Tale Norm: $\\ell_2$ Magnitude as a Signal for Reasoning Dynamics in Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T02:07:49.501480Z"},"links":{"cited_paper":"/paper/2507.22928","citing_paper":"/paper/2606.06188"},"observation_digest":"sha256:db3e81bee86f1235e12c79ed7645499948bbcdfb6c1a2ae3c5d909a273e9a831","observation_id":"d3757901-b926-4635-8ef6-a6577f73d58e","resolution":{"observed_at":"2026-07-02T12:26:56.910598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"cited_work":{"arxiv_id":"2507.22928","doi":"10.48550/arxiv.2507.22928","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22928","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2507.22928 , year=","venue":"ArXiv.org","work_id":"6b0774d2-1143-4bcb-8eae-f4b37a01dfa3","year":null},"citing_paper":{"arxiv_id":"2606.06840","last_updated":"2026-06-05T02:32:24Z","snapshot_observed_at":"2026-08-05T15:03:33.373071Z","submitted_at":"2026-06-05T02:32:24Z","title":"Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-27T22:22:52.690010Z"},"links":{"cited_paper":"/paper/2507.22928","citing_paper":"/paper/2606.06840"},"observation_digest":"sha256:50804633198954bb9efd594f4c63e11ac0f2d9ba41af67d82dae7d987ed161de","observation_id":"bb601e90-db41-492e-a2db-e7cb53e512f7","resolution":{"observed_at":"2026-06-27T22:31:21.457839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22928","snapshot_observed_at":"2026-08-12T00:23:50.436202Z","title":"How does chain of thought think? mechanistic interpretability of chain-of-thought reasoning with sparse autoencoding.arXiv preprint arXiv:2507.22928, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08168","last_updated":"2026-08-08T14:54:13Z","snapshot_observed_at":"2026-08-16T08:45:12.335502Z","submitted_at":"2026-08-08T14:54:13Z","title":"Thinking vs. NoThinking: Towards Interpreting Reasoning Mechanisms of Large Language Models via Sparse Autoencoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:23:50.436202Z"},"links":{"cited_paper":"/paper/2507.22928","citing_paper":"/paper/2608.08168"},"observation_digest":"sha256:a3eafe10aee9dd822d305b2376b6dfdd067081713f9f79bca71bfc587bb2a1d8","observation_id":"33f4f543-12ee-479c-82d3-1435710c04de","resolution":{"observed_at":"2026-08-12T00:23:50.436202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22928/citation-record","integrity":"/paper/2507.22928/integrity","json":"/paper/2507.22928/citation-record.json","paper":"/paper/2507.22928"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.861030Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.861030Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:fc8410b4e2bddb89f2f387188889553f2ca3a72ce6c68a316e9573bb8d430572","observation_id":"589de791-c76f-43cd-8f54-3e9053be49ce","resolution":{"observed_at":"2026-08-15T18:21:12.861030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.865106Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.865106Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:81762bf1ec2e21067931dddbda7ba7292beedc7ce20323e7a25ada7f6b956f10","observation_id":"8cba9de4-e288-4b6a-a03b-22af76670bf0","resolution":{"observed_at":"2026-08-15T18:21:12.865106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04614","last_updated":"2024-03-14T03:48:08Z","snapshot_observed_at":"2026-08-16T14:20:44.189785Z","submitted_at":"2024-02-07T06:32:50Z","title":"Faithfulness vs. Plausibility: On the (Un)Reliability of Explanations from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04614","snapshot_observed_at":"2026-08-15T18:21:12.869648Z","title":"H.; and Lakkaraju, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.869648Z"},"links":{"cited_paper":"/paper/2402.04614","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:efeeb8a463372d4ea9923a004949bf3863ecd20648655aa29de7da56b84bf389","observation_id":"106c5eff-deb8-4ab6-bc70-350596a3e86b","resolution":{"observed_at":"2026-08-15T18:21:12.869648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18029","last_updated":"2023-06-30T15:41:47Z","snapshot_observed_at":"2026-08-14T23:52:11.180283Z","submitted_at":"2023-05-29T11:40:37Z","title":"Faithfulness Tests for Natural Language Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18029","snapshot_observed_at":"2026-08-15T18:21:12.873916Z","title":"G.; and Augenstein, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.873916Z"},"links":{"cited_paper":"/paper/2305.18029","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:11936c9da3d4e6b469a68605276401f39b2797baf5681ebe615b1407acdc1ec5","observation_id":"b03b5c8c-4166-4d74-8ec5-fd57b9eb772e","resolution":{"observed_at":"2026-08-15T18:21:12.873916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.878718Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.878718Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:64494cfd931349744b36751fb5afca6dd4f891998568ca0c29dc74dfe2aa6e3c","observation_id":"78812c5a-0f7a-42f8-bf0a-e3bcb12a2722","resolution":{"observed_at":"2026-08-15T18:21:12.878718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-15T18:21:12.882758Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.882758Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:74a7563c2fc5a88701d3059de29b1f9d0ce36b46848b01c82d5f83e01680bdd6","observation_id":"b6a19327-babd-4d79-942c-b6ca9de3979d","resolution":{"observed_at":"2026-08-15T18:21:12.882758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.886688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.886688Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:0999d06b56f8fb5256f2920150c66251fe51f5f74f07b69c627b8d7e741b80e3","observation_id":"13ba8ede-40fb-478f-9649-b849430f5504","resolution":{"observed_at":"2026-08-15T18:21:12.886688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:13.691288Z","title":null,"venue":null,"work_id":"c1a3fb2c-4448-45e8-8f42-2984d01be701","year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.890429Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:9eed03a0fa4be1cc9ea9a352f3acdc2c02efff76dd8f36883771e53bd37c6e4a","observation_id":"b252c6dd-a085-447d-84a0-45df8c31833c","resolution":{"observed_at":"2026-08-15T18:21:13.695349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.894293Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.894293Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:009a5fae305422cd75e175f21d4befd11e73edd044eaf72bf4f8d353fc61b6d3","observation_id":"61588e45-37d7-460e-a66d-4d184a866645","resolution":{"observed_at":"2026-08-15T18:21:12.894293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.897903Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.897903Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:9cb367ab20fcf2c2dfac3059c959554d906229f43eef3f44706e547d7c58ee8a","observation_id":"459d7a01-4595-4e8a-b906-e9afa15921a1","resolution":{"observed_at":"2026-08-15T18:21:12.897903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T18:21:12.903109Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.903109Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:18e7943f2ecd683d44f7c5b9184cbecde521c7329a23ce73bca3583ca0728ab2","observation_id":"def9c75a-a17d-475b-a93b-b8aef5fe897a","resolution":{"observed_at":"2026-08-15T18:21:12.903109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-16T13:37:26.527260Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-15T18:21:12.906793Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.906793Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:3272d5ebf7e485724c6bc302223be649e2a53615e4fbc9d05a6060f0d6ebed5d","observation_id":"168f8ef2-7449-45bf-80ee-9b7cb38b18a5","resolution":{"observed_at":"2026-08-15T18:21:12.906793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01280","last_updated":"2024-10-02T06:51:12Z","snapshot_observed_at":"2026-08-16T13:13:29.614899Z","submitted_at":"2024-10-02T06:51:12Z","title":"Sparse Autoencoders Reveal Temporal Difference Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01280","snapshot_observed_at":"2026-08-15T18:21:12.910702Z","title":"K.; Binz, M.; and Schulz, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.910702Z"},"links":{"cited_paper":"/paper/2410.01280","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:2d982b3a176635fae3a9d2b53c20b579001bdb03eac9527282b4bbe697af4108","observation_id":"e6ca6c23-b91a-41c4-af27-5b27f1d34dc7","resolution":{"observed_at":"2026-08-15T18:21:12.910702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17332","last_updated":"2025-02-24T17:04:24Z","snapshot_observed_at":"2026-08-16T12:55:40.077556Z","submitted_at":"2025-02-24T17:04:24Z","title":"Tokenized SAEs: Disentangling SAE Reconstructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17332","snapshot_observed_at":"2026-08-15T18:21:12.914460Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.914460Z"},"links":{"cited_paper":"/paper/2502.17332","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:94060fe59e4b186b1e5878793f348ee17d8357f8ab2357b4f6241f518a1cd500","observation_id":"485cd831-2509-4d88-939e-77bf015a0b33","resolution":{"observed_at":"2026-08-15T18:21:12.914460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18312","last_updated":"2024-05-06T09:16:15Z","snapshot_observed_at":"2026-08-16T14:14:32.681492Z","submitted_at":"2024-02-28T13:14:20Z","title":"How to think step-by-step: A mechanistic understanding of chain-of-thought reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18312","snapshot_observed_at":"2026-08-15T18:21:12.918891Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.918891Z"},"links":{"cited_paper":"/paper/2402.18312","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:b086fd9e1c5f8ccc1477b62e2bc7a4bf53e11acc6fea8591c8f1604ddaeff59a","observation_id":"7b685728-a967-4ea0-8ae6-1d06d751be4c","resolution":{"observed_at":"2026-08-15T18:21:12.918891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-15T18:21:12.922606Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.922606Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:79c9d663581a60499092f9ad7628d595f6287cbb77eeea2c5989e534e6eb5a6e","observation_id":"35ad841d-6112-4508-badd-4358206a5a3d","resolution":{"observed_at":"2026-08-15T18:21:12.922606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04709","last_updated":"2025-05-08T23:00:37Z","snapshot_observed_at":"2026-08-13T13:05:41.356773Z","submitted_at":"2023-01-11T20:42:41Z","title":"Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04709","snapshot_observed_at":"2026-08-15T18:21:12.926237Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.926237Z"},"links":{"cited_paper":"/paper/2301.04709","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:6e47bc024f583c0a5b5879f262befa24a49929c039f96ea9001c2b9363d33493","observation_id":"d7dee443-348d-4baa-98ad-9c9fe9f2a572","resolution":{"observed_at":"2026-08-15T18:21:12.926237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:13.673754Z","title":null,"venue":null,"work_id":"bc98ef68-c2c0-4f09-b58f-38ef59e3981d","year":2021},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.929728Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:f3df696bf4779b13007ff0c82768d08aaa7f9864e47b18d91f204d1eb6552a7c","observation_id":"d950279e-504f-4308-987a-7645c75dc822","resolution":{"observed_at":"2026-08-15T18:21:13.677354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:13.662961Z","title":null,"venue":null,"work_id":"e1980491-c801-4ae6-bc07-28230e30cbc3","year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.933466Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:e28b8cdc3f2b3b24bf4469fcf52aebe2d66fc4beb241196c9789f6070b387588","observation_id":"7b5b762f-7987-4fcb-863c-05c41b7b873e","resolution":{"observed_at":"2026-08-15T18:21:13.666656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05969","last_updated":"2023-05-16T16:24:55Z","snapshot_observed_at":"2026-08-15T09:56:57.369509Z","submitted_at":"2023-04-12T16:46:43Z","title":"Localizing Model Behavior with Path Patching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05969","snapshot_observed_at":"2026-08-15T18:21:12.936927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.936927Z"},"links":{"cited_paper":"/paper/2304.05969","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:0a8d1f38b4a1656a88d86562c36042b16b1a947ad1f562ef5601ace4b6f03fd4","observation_id":"25152b33-d5e2-4a7f-9ede-46a2cef824ca","resolution":{"observed_at":"2026-08-15T18:21:12.936927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:13.651804Z","title":null,"venue":null,"work_id":"a231ee3a-ac2b-48ae-a30e-62cbddf44bcb","year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.940718Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:1b9a45444dabfc2cc87d069b241d265c8ea1e5eade215b97d27a1331b292629a","observation_id":"e151c6df-458c-4509-a624-7cfb9d0b00bb","resolution":{"observed_at":"2026-08-15T18:21:13.655664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15255","last_updated":"2024-04-23T17:42:29Z","snapshot_observed_at":"2026-08-12T21:46:28.191953Z","submitted_at":"2024-04-23T17:42:29Z","title":"How to use and interpret activation patching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15255","snapshot_observed_at":"2026-08-15T18:21:12.944225Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.944225Z"},"links":{"cited_paper":"/paper/2404.15255","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:271f75433a840a0b391bdeb90d9929ec00c0113a2830ca7f31cfbef8d36f3d9b","observation_id":"fb418409-32c5-4df7-8c80-eac30f3b189e","resolution":{"observed_at":"2026-08-15T18:21:12.944225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18895","last_updated":"2024-11-28T03:58:48Z","snapshot_observed_at":"2026-08-16T14:32:28.953262Z","submitted_at":"2024-11-28T03:58:48Z","title":"Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18895","snapshot_observed_at":"2026-08-15T18:21:12.948006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.948006Z"},"links":{"cited_paper":"/paper/2411.18895","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:5f2bd96843e4d26a6d4b64f29b76d235b14e96a48732da1a27dba515592fd4b2","observation_id":"1f992757-a0f2-4c94-8baf-fd3dd9143563","resolution":{"observed_at":"2026-08-15T18:21:12.948006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.951668Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.951668Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:14235e284ab2b131806635ee46616078606a5d0127475668c5a2a8e451acc9b4","observation_id":"11333139-959c-4dae-8959-2d3e5f45c216","resolution":{"observed_at":"2026-08-15T18:21:12.951668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21779","last_updated":"2024-10-29T06:38:46Z","snapshot_observed_at":"2026-08-16T13:05:05.537136Z","submitted_at":"2024-10-29T06:38:46Z","title":"Leveraging LLMs for Hypothetical Deduction in Logical Inference: A Neuro-Symbolic Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21779","snapshot_observed_at":"2026-08-15T18:21:12.955346Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.955346Z"},"links":{"cited_paper":"/paper/2410.21779","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:9e42040747b872a69ea83b84a639269a1e7f22c17da947df2708f82ede30515a","observation_id":"6cc4ecbe-6206-473b-ac57-528640a35ad9","resolution":{"observed_at":"2026-08-15T18:21:12.955346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17030","last_updated":"2023-12-06T14:28:46Z","snapshot_observed_at":"2026-08-16T14:39:31.719225Z","submitted_at":"2023-11-28T18:32:19Z","title":"Is This the Subspace You Are Looking for? An Interpretability Illusion for Subspace Activation Patching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17030","snapshot_observed_at":"2026-08-15T18:21:12.958974Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.958974Z"},"links":{"cited_paper":"/paper/2311.17030","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:31f1ce7055f61ed8c665292a2f31def598f59bf2c8d4d096ae5aef8eea9dc105","observation_id":"3eb7d61f-4e0e-4ed5-ae7c-019584a9d4df","resolution":{"observed_at":"2026-08-15T18:21:12.958974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-08-14T07:35:01.333549Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-15T18:21:12.963135Z","title":"J.; Belinkov, Y.; Bau, D.; and Mueller, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.963135Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:0da55cdc154480989fe2f25e6e830c1f555a4ea142c7d26350f92d511a022f90","observation_id":"697195d0-f591-491d-b3d1-f19c8100bd5c","resolution":{"observed_at":"2026-08-15T18:21:12.963135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14150","last_updated":"2025-05-20T14:36:36Z","snapshot_observed_at":"2026-08-16T11:53:23.658288Z","submitted_at":"2025-04-19T02:51:20Z","title":"Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14150","snapshot_observed_at":"2026-08-15T18:21:12.966829Z","title":"O.; Guttag, J.; and K c man, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.966829Z"},"links":{"cited_paper":"/paper/2504.14150","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:8c936831a395f09ab78266b5016d1653117ecf80c942c4e23275d2a0ea5d7a53","observation_id":"3ef01f3c-ed5d-45e6-944d-fe60c2148131","resolution":{"observed_at":"2026-08-15T18:21:12.966829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.970470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.970470Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:9136f1bedc973c19adfa05119c847d420556bab20ed2710496da8f1f116df8b5","observation_id":"54ef891a-87aa-411a-a459-061e9adbc338","resolution":{"observed_at":"2026-08-15T18:21:12.970470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11767","last_updated":"2025-02-05T13:11:10Z","snapshot_observed_at":"2026-08-16T13:09:06.676395Z","submitted_at":"2024-10-15T16:42:13Z","title":"Analyzing (In)Abilities of SAEs via Formal Languages","version":4},"cited_work":{"arxiv_id":"2410.11767","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11767","snapshot_observed_at":"2026-08-15T18:21:13.218535Z","title":"Analyzing (In)Abilities of SAEs via Formal Languages","venue":"cs.LG","work_id":"fa4d2d34-c585-4b62-aced-ff65ee4cc205","year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.974022Z"},"links":{"cited_paper":"/paper/2410.11767","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:66c77b9174d490504bf69239ff9ed15321ab8c1e4b631c59d7cbbf299fdcda43","observation_id":"23463316-1fb9-47ce-a4bc-ba00203caec3","resolution":{"observed_at":"2026-08-15T18:21:13.222900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-15T18:21:12.977751Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.977751Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:e7fa30b5b122236037551d8b8c6d247ddd429a33e2b5c4f18743def63fb3528c","observation_id":"0035dd49-a209-46dc-8421-0ac66948edcc","resolution":{"observed_at":"2026-08-15T18:21:12.977751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13950","last_updated":"2024-10-06T17:54:06Z","snapshot_observed_at":"2026-08-16T14:16:31.474049Z","submitted_at":"2024-02-21T17:23:59Z","title":"Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13950","snapshot_observed_at":"2026-08-15T18:21:12.982072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.982072Z"},"links":{"cited_paper":"/paper/2402.13950","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:c253a3b5f2ada22a7911e09931e4fb3ec32ed6e36ea2ae8b7b606031ececa590","observation_id":"c52bc77d-6ced-4579-a42f-72044479ff24","resolution":{"observed_at":"2026-08-15T18:21:12.982072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:12.985706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.985706Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:2c5e4dd67dc50ad18582b6d2b4419faeeced2f21fc9ae275c6907185e66a4bb6","observation_id":"ba748365-a235-45b5-804d-54fc01958b25","resolution":{"observed_at":"2026-08-15T18:21:12.985706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:13.627902Z","title":null,"venue":null,"work_id":"c86039b0-9939-4598-b41c-c1082092192d","year":2025},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.989446Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:d7b37f000ce5a0eb8cf967bf42b3fce8b9284196126cd64564b94bc752e96d95","observation_id":"bb4680d5-af6c-4c09-95b2-3720a02b48df","resolution":{"observed_at":"2026-08-15T18:21:13.631586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03189","last_updated":"2024-06-07T11:54:44Z","snapshot_observed_at":"2026-08-16T14:03:45.188576Z","submitted_at":"2024-04-04T04:20:04Z","title":"The Probabilities Also Matter: A More Faithful Metric for Faithfulness of Free-Text Explanations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.03189","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03189","snapshot_observed_at":"2026-08-15T18:21:13.120378Z","title":"The Probabilities Also Matter: A More Faithful Metric for Faithfulness of Free-Text Explanations in Large Language Models","venue":"cs.CL","work_id":"e16cef4a-2c52-4c5e-98ef-cf6333dd28c1","year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.994249Z"},"links":{"cited_paper":"/paper/2404.03189","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:d16d2ed80f59d3d17373a090d0dc885a56734cd8aa2e8a7d2f223977b45a585e","observation_id":"e031bf3b-b3fc-4283-a6ba-816988a247eb","resolution":{"observed_at":"2026-08-15T18:21:13.124489Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05817","last_updated":"2024-11-09T10:19:02Z","snapshot_observed_at":"2026-08-16T13:11:36.214546Z","submitted_at":"2024-10-08T08:47:11Z","title":"Probing Language Models on Their Knowledge Source","version":3},"cited_work":{"arxiv_id":"2410.05817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05817","snapshot_observed_at":"2026-08-15T18:21:13.103060Z","title":"Probing Language Models on Their Knowledge Source","venue":"cs.CL","work_id":"4e5e1502-b3f2-42ac-a126-ee3ed4e6e8df","year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:12.998112Z"},"links":{"cited_paper":"/paper/2410.05817","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:5f93c4b2e0a07b0c3d2a840babf85e65e0ce00ff72c80cc8890d805288bb125b","observation_id":"3fe42dd0-8a06-4ff8-a738-a41e1a05585c","resolution":{"observed_at":"2026-08-15T18:21:13.109366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:21:13.002452Z","title":"V.; Zhou, D.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:13.002452Z"},"links":{"citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:69a40ae544943044f65abd9dabb70a0ffa28fdf56e47373d0fa7e90248612475","observation_id":"38e2da06-e909-45a2-ae9a-51d3dd12b152","resolution":{"observed_at":"2026-08-15T18:21:13.002452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12631","last_updated":"2024-01-23T10:27:42Z","snapshot_observed_at":"2026-08-16T14:47:32.840804Z","submitted_at":"2024-01-23T10:27:42Z","title":"A Reply to Makelov et al. (2023)'s \"Interpretability Illusion\" Arguments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12631","snapshot_observed_at":"2026-08-15T18:21:13.006013Z","title":"interpretability illusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:13.006013Z"},"links":{"cited_paper":"/paper/2401.12631","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:e18437b775bb988f21fefca3de31e2d272afae04f4190c3f62c7b54b9763fcc9","observation_id":"246d8e9a-f30e-48ba-a294-583f0470e090","resolution":{"observed_at":"2026-08-15T18:21:13.006013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18357","last_updated":"2024-06-11T07:41:03Z","snapshot_observed_at":"2026-08-16T13:48:32.044219Z","submitted_at":"2024-05-28T16:55:33Z","title":"Faithful Logical Reasoning via Symbolic Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18357","snapshot_observed_at":"2026-08-15T18:21:13.009786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:13.009786Z"},"links":{"cited_paper":"/paper/2405.18357","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:dfe20d7b31af77d25614c141f4e8d64581e1533efb2673701f388160248be896","observation_id":"77d34e41-ec87-4778-9277-ae9e8c4fa7c1","resolution":{"observed_at":"2026-08-15T18:21:13.009786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15092","last_updated":"2024-09-02T22:40:20Z","snapshot_observed_at":"2026-08-16T13:49:58.172735Z","submitted_at":"2024-05-23T22:38:58Z","title":"Dissociation of Faithful and Unfaithful Reasoning in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15092","snapshot_observed_at":"2026-08-15T18:21:13.013526Z","title":"H.; Paturi, R.; and Bergen, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:13.013526Z"},"links":{"cited_paper":"/paper/2405.15092","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:c47539b325ae808e04b93ca95dbad1e89a27507a9233912e03f600468bbbc5be","observation_id":"c936717b-1635-4f66-9174-7e9e582abf1a","resolution":{"observed_at":"2026-08-15T18:21:13.013526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14155","last_updated":"2024-11-01T06:19:47Z","snapshot_observed_at":"2026-08-16T13:08:10.835079Z","submitted_at":"2024-10-18T03:45:42Z","title":"Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14155","snapshot_observed_at":"2026-08-15T18:21:13.017376Z","title":"J.; Satapathy, R.; and Cambria, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:13.017376Z"},"links":{"cited_paper":"/paper/2410.14155","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:a0bf001770f3ffdf35e93eae12abedc18599ef68d3be3f9e4fc5fbf5559e7129","observation_id":"49c888dd-6035-4b3b-87a5-a271be3a721f","resolution":{"observed_at":"2026-08-15T18:21:13.017376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16042","last_updated":"2024-01-17T04:07:06Z","snapshot_observed_at":"2026-08-08T04:58:14.317234Z","submitted_at":"2023-09-27T21:53:56Z","title":"Towards Best Practices of Activation Patching in Language Models: Metrics and Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16042","snapshot_observed_at":"2026-08-15T18:21:13.021612Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:13.021612Z"},"links":{"cited_paper":"/paper/2309.16042","citing_paper":"/paper/2507.22928"},"observation_digest":"sha256:42be023525b0b46a862dffb2530a5dfc6e1039dee9615559f2d5840b5da813c4","observation_id":"65cb181a-6b30-493e-b970-ff4b516736f0","resolution":{"observed_at":"2026-08-15T18:21:13.021612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22928","last_updated":"2025-07-24T10:25:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:13:50.697259Z","submitted_at":"2025-07-24T10:25:46Z","title":"How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 3 inbound Pith citation observations for arXiv:2507.22928."}