{"as_of":"2026-08-09T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8212130ee8b90f2367e23a0cb02941b01315fd8151de70864ce8e4177adbd4d8","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:43:52.365784Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.12879/citation-record","integrity":"/paper/2601.12879/integrity","json":"/paper/2601.12879/citation-record.json","paper":"/paper/2601.12879"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.125275Z","title":"On the biology of a large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.125275Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:a66f1587cd261411dbca86f0f056f675f3be4dc3256c16ee13565c485fdca2e6","observation_id":"d0cc2fb5-b57f-4b0a-81a7-667964faf50b","resolution":{"observed_at":"2026-08-03T09:43:49.125275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.235460Z","title":"Neuron-level circuits: Pruning MLPs to interpret their weights,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.235460Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:ea911bbd86adeaf8f9921cee3634412a6729e988da3c9c2e7fceca549602bbef","observation_id":"391cb797-e7a6-493c-be4d-39c5b88a5fe3","resolution":{"observed_at":"2026-08-03T09:43:49.235460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.304775Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.304775Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:ab073137e1ac7f6fca729f21902771614e87919defe0012be2cabcd071f79e01","observation_id":"d7548e98-44fb-43b2-a42c-a944b2ad7626","resolution":{"observed_at":"2026-08-03T09:43:49.304775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.398597Z","title":"Towards automated circuit discovery for mechanistic interpretability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.398597Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:33a4f879868d0885566395eebee3c0bbb733f5fb9fe15abf3d5211756e9b10ce","observation_id":"802fd163-2658-46b5-8e27-14945fd23d91","resolution":{"observed_at":"2026-08-03T09:43:49.398597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.534573Z","title":"Sparse autoencoders find highly interpretable features in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.534573Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:73e21d208ea60c8d6b39abe84844d0c3ac1df84f306cfd1bb1c4bfb45dcafc37","observation_id":"faa2c21d-e8bc-478d-858e-625c118b0fa3","resolution":{"observed_at":"2026-08-03T09:43:49.534573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.641496Z","title":"A mathematical framework for transformer circuits,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.641496Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:5531d985759ca1197ab79e83cb3367923d21d936d963b8ad8290f5ee5472f89f","observation_id":"fd28ad7c-102e-440f-a88c-684c6b7f23d3","resolution":{"observed_at":"2026-08-03T09:43:49.641496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-03T09:43:49.711493Z","title":"Scaling and evaluating sparse autoencoders,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.711493Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:6d2d01658bddaf9c7a0adb28ac9a9aa84623b6f6191f3ebd28cf5ea1b52ec6a6","observation_id":"835c8bab-0aa1-4283-ace1-20176783805a","resolution":{"observed_at":"2026-08-03T09:43:49.711493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.812527Z","title":"Weight-sparse transformers enable circuit- level interpretability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.812527Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:5c0a9926081e7c2d0d55215a314bf228cfec5dea5120c224150b3b90b3a8f0bb","observation_id":"f7923efe-a802-45c1-8707-cda8d1dfea50","resolution":{"observed_at":"2026-08-03T09:43:49.812527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:49.923000Z","title":"How does GPT-2 compute greater- than? Interpreting mathematical abilities in a pre-trained language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:49.923000Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:759768509ce1e0452406a3169f1272cd1d4ec43ea71baf486aeef3cb85f2b902","observation_id":"31ae78bf-96ed-4ae4-9325-64323a8dc453","resolution":{"observed_at":"2026-08-03T09:43:49.923000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-03T09:43:50.035165Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.035165Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:e39c1abe754bad0d4ba460c47958715494bf47cd58a969a268f8972b71192431","observation_id":"ab53a23b-8503-44ad-9294-6d414d599586","resolution":{"observed_at":"2026-08-03T09:43:50.035165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.137289Z","title":"Locating and editing factual associations in GPT,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.137289Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:67fb6c71fb261c2c16c4277a3aa75a575362d05981e9716d98a3a5e4678a4ab7","observation_id":"4b0637bd-db8f-4c28-beb2-1e266751d905","resolution":{"observed_at":"2026-08-03T09:43:50.137289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05110","last_updated":"2024-02-07T18:59:12Z","snapshot_observed_at":"2026-07-06T17:26:59.606509Z","submitted_at":"2024-02-07T18:59:12Z","title":"Opening the AI black box: program synthesis via mechanistic interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05110","snapshot_observed_at":"2026-08-03T09:43:50.257577Z","title":"Opening the AI black box: Program synthesis via mechanistic interpretability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.257577Z"},"links":{"cited_paper":"/paper/2402.05110","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:2407fed8e7f2dd8a7e8733ce0236e1bd35554f754e82a48658063dddc112af87","observation_id":"dcc84977-3b77-42ba-8fc9-d8c2854ad4db","resolution":{"observed_at":"2026-08-03T09:43:50.257577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.367945Z","title":"Progress measures for grokking via mechanistic interpretability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.367945Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:9998ded5c9c73fa81035da053d7ac874d1cce6b2a9d5de669053d565288d463b","observation_id":"6266d2e6-4d8b-4f1a-a207-59b4d869d5d4","resolution":{"observed_at":"2026-08-03T09:43:50.367945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.503592Z","title":"Zoom in: An introduction to circuits,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.503592Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:8a4d6dfdfb2a0c5fa92c7c9249ac50ab6d48533c1b5cc7a263a8f720f65f5f3a","observation_id":"06044f44-1c1d-493f-8975-e7a5cd4fb4df","resolution":{"observed_at":"2026-08-03T09:43:50.503592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.599223Z","title":"In-context learning and induction heads,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.599223Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:c6942117e44a6fc521a4b7f293f672d0822db9ed9cf064fd4075dd325d830f7a","observation_id":"4abdb7b7-c840-403d-b933-8e9640cbb065","resolution":{"observed_at":"2026-08-03T09:43:50.599223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.694901Z","title":"Interpretability in weight-sparse language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.694901Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:4ee42ffdd610141ec897e7cd5567264181f225d931775afb9b60608f8946790a","observation_id":"c0de4904-b85e-414f-b009-f53bfdfae9a4","resolution":{"observed_at":"2026-08-03T09:43:50.694901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.793355Z","title":"WinoGrande: An adversarial Winograd schema challenge at scale,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.793355Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:010ad14eb95121e3ab7542d903e7de3e5b4e95e24126d8d377ec642fe0cb13ef","observation_id":"3c5c2b99-3f9d-4601-8375-34f7b0095473","resolution":{"observed_at":"2026-08-03T09:43:50.793355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.857300Z","title":"Axiomatic attribution for deep networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.857300Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:23b010d77a5fff7a3476e423a78c0129ebb7d341775ab289f61cfbf41215a2c6","observation_id":"6a87aa4f-61bd-4a52-bd04-0984d6918f92","resolution":{"observed_at":"2026-08-03T09:43:50.857300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:50.918324Z","title":"Graph attention networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:50.918324Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:e3927f39174b011d935c778114191d4837ce72e40a0ff09c39974f545b8bf7cb","observation_id":"77943da8-d398-4488-a65e-a657a04e3cff","resolution":{"observed_at":"2026-08-03T09:43:50.918324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.014469Z","title":"A tutorial on spectral clustering,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.014469Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:e9defa0094689f68e117cf6495a5235f746e737589e809d9cbb166ff31c7ad3f","observation_id":"bb9c5879-4246-498a-9555-3f30ae24c950","resolution":{"observed_at":"2026-08-03T09:43:51.014469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.120300Z","title":"Interpretability in the wild: A circuit for indirect object identification in GPT-2 small,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.120300Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:00f097da66e9443ce3d5619f9dbe48d2f03a07ab072afb997137110f8eb0cdab","observation_id":"3db8098d-c348-4ddc-ba18-173046f9eed1","resolution":{"observed_at":"2026-08-03T09:43:51.120300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.223515Z","title":"HellaSwag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.223515Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:3d0a874bbb53765d8713d40322e48de54d855c500ef21a8e4660f56d67c6b82c","observation_id":"3309cf29-2ca0-489c-a845-785cf7340b0f","resolution":{"observed_at":"2026-08-03T09:43:51.223515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.305333Z","title":"Defining and quantifying the emergence of sparse concepts in DNNs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.305333Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:24adcda5c1d325e16c3c487a2a403c8d31de171db7fd3ffd7f852a3becaa26f6","observation_id":"1ab5c987-1b91-4bbf-a132-c016e5f8b48b","resolution":{"observed_at":"2026-08-03T09:43:51.305333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13091","last_updated":"2024-09-13T09:19:14Z","snapshot_observed_at":"2026-07-06T14:55:45.711180Z","submitted_at":"2023-02-25T14:44:40Z","title":"Explaining Generalization Power of a DNN Using Interactive Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13091","snapshot_observed_at":"2026-08-03T09:43:51.389495Z","title":"Explaining generalization power of a DNN using interactive concepts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.389495Z"},"links":{"cited_paper":"/paper/2302.13091","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:0e9c1e598b4a5af12e5a76091aba72ea797e618243f4e2819d0dd299e2d28fe7","observation_id":"14567aa2-d0be-4117-9d97-a26f66e3f28e","resolution":{"observed_at":"2026-08-03T09:43:51.389495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01939","last_updated":"2024-09-13T09:22:38Z","snapshot_observed_at":"2026-07-06T15:22:40.401971Z","submitted_at":"2023-05-03T07:32:28Z","title":"Where We Have Arrived in Proving the Emergence of Sparse Symbolic Concepts in AI Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01939","snapshot_observed_at":"2026-08-03T09:43:51.444060Z","title":"Where we have arrived in proving the emergence of sparse symbolic concepts in AI models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.444060Z"},"links":{"cited_paper":"/paper/2305.01939","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:1921b904af8186744d014e9020a72845b22048dd59da0b8ec0b70b33741f3bfc","observation_id":"108f8857-6bb4-4ef9-a159-34eaad577db0","resolution":{"observed_at":"2026-08-03T09:43:51.444060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.571509Z","title":"Discovering transformer circuits via a hybrid attribution and pruning framework,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.571509Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:3d39ed3ddd1553513482a4c0844ca4bd7e64967d0edaa898acb3fceac4372537","observation_id":"7661e431-78d3-4658-89f7-ff4c76786339","resolution":{"observed_at":"2026-08-03T09:43:51.571509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16778","last_updated":"2025-04-02T15:50:36Z","snapshot_observed_at":"2026-07-06T18:36:07.983955Z","submitted_at":"2024-06-24T16:40:54Z","title":"Finding Transformer Circuits with Edge Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16778","snapshot_observed_at":"2026-08-03T09:43:51.664374Z","title":"Finding transformer circuits with edge pruning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.664374Z"},"links":{"cited_paper":"/paper/2406.16778","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:cd39b15a390f19223537a8da73118bd75bd568807a5ca67766d989bef0603293","observation_id":"32c0e022-4ff3-4b37-ab01-bc282130c0b7","resolution":{"observed_at":"2026-08-03T09:43:51.664374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10928","last_updated":"2024-05-20T16:34:37Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:27:19Z","title":"The Local Interaction Basis: Identifying Computationally-Relevant and Sparsely Interacting Features in Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10928","snapshot_observed_at":"2026-08-03T09:43:51.759455Z","title":"The local interaction basis: Identifying computationally-relevant and sparsely interacting features in neural networks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.759455Z"},"links":{"cited_paper":"/paper/2405.10928","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:a5372c6a0a8c744272dccf679c61c836ffceedd4348fc5ee963be05eb98652fc","observation_id":"41f662ed-8cda-45f9-8513-d84adc21fdd9","resolution":{"observed_at":"2026-08-03T09:43:51.759455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:51.848811Z","title":"Functional faithfulness in the wild: Circuit discovery with differentiable computation graph pruning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.848811Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:5b52fe964357ed2a7150dc2cb53d08f6c77c42278fa7ad7f7110ec366f7e2d2d","observation_id":"e6ba8fc2-78e3-4460-b558-56d18494edc5","resolution":{"observed_at":"2026-08-03T09:43:51.848811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13868","last_updated":"2024-07-21T11:42:32Z","snapshot_observed_at":"2026-08-02T09:03:28.447459Z","submitted_at":"2024-05-22T17:50:04Z","title":"Automatically Identifying Local and Global Circuits with Linear Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13868","snapshot_observed_at":"2026-08-03T09:43:51.976205Z","title":"Automatically identifying local and global circuits with linear computation graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:51.976205Z"},"links":{"cited_paper":"/paper/2405.13868","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:0acccfe1a44f6fb152d55a45c7df33c02db95ce3a12e56f3c4104aec7ded6559","observation_id":"5654fa34-3495-42a0-9255-8f73d36c51b5","resolution":{"observed_at":"2026-08-03T09:43:51.976205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18147","last_updated":"2025-06-06T11:10:03Z","snapshot_observed_at":"2026-08-07T17:50:17.102928Z","submitted_at":"2025-02-25T12:21:45Z","title":"Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18147","snapshot_observed_at":"2026-08-03T09:43:52.064760Z","title":"Jacobian sparse autoen- coders: Sparsify computations, not just activations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.064760Z"},"links":{"cited_paper":"/paper/2502.18147","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:eee8c88967efaa2982b9769e9af4cb981bef9d1a4af03a508d29e8b96d090cea","observation_id":"869198f6-eea5-4563-9323-7ec30859625e","resolution":{"observed_at":"2026-08-03T09:43:52.064760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:52.156854Z","title":"Weight-sparse transformers have interpretable circuits,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.156854Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:76a23cdc89d242f2215fc13bfc7277e87c15bb59000fe58a056a9a7509a9f1c9","observation_id":"0d05f45f-e122-4ca0-b692-394ffce71a70","resolution":{"observed_at":"2026-08-03T09:43:52.156854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:52.248658Z","title":"Language models can explain neurons in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.248658Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:170d895e268ed540cfc74033eb1124318caddcf7aca29544a6a3d875672d7b30","observation_id":"320a465d-0560-4a4a-8d81-b6836593b1a3","resolution":{"observed_at":"2026-08-03T09:43:52.248658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:43:52.314120Z","title":"Scaling monosemanticity: Extracting interpretable features from Claude 3 Sonnet,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.314120Z"},"links":{"citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:4eecabe267661c1326f08c837a6b0ed68c6fae3c6d1787d3370cdb38b3e7cc9b","observation_id":"d3f8a902-d44a-4d03-aac9-0cbb97c3e0c1","resolution":{"observed_at":"2026-08-03T09:43:52.314120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09458","last_updated":"2023-07-24T08:32:40Z","snapshot_observed_at":"2026-07-06T15:55:28.974661Z","submitted_at":"2023-07-18T17:39:04Z","title":"Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09458","snapshot_observed_at":"2026-08-03T09:43:52.365784Z","title":"Does circuit analysis interpretability scale? Evi- dence from multiple choice capabilities in Chinchilla,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:52.365784Z"},"links":{"cited_paper":"/paper/2307.09458","citing_paper":"/paper/2601.12879"},"observation_digest":"sha256:1d3e3b60306e0ae8c4bbc2120baea003e52237a7bb36bf52202bc036ef775581","observation_id":"099071a3-e247-46cf-b4f2-f173e10818af","resolution":{"observed_at":"2026-08-03T09:43:52.365784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.12879","last_updated":"2026-06-20T08:42:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T17:38:13.758328Z","submitted_at":"2026-01-19T09:34:10Z","title":"Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2601.12879."}