{"as_of":"2026-08-19T09:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:571ff23fabc683f1d0319acca02f53bf97f613e3c7f9bcfcb4d1b8c7767ccc8e","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:41:57.857103Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12268/citation-record","integrity":"/paper/2505.12268/integrity","json":"/paper/2505.12268/citation-record.json","paper":"/paper/2505.12268"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:58.710685Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":"ab19611c-08fb-42c7-8d88-d92f7f78d391","year":2019},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.697855Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:8c8c706db7380f11f66b02628abbdbac5dada01a58e811e379381d13f57d71fd","observation_id":"a5082a35-1917-4b11-9bee-9eba6da766fa","resolution":{"observed_at":"2026-08-15T20:41:58.720514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-16T13:37:26.527260Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-15T20:41:57.713019Z","title":"Clément Dumas, Jiannan Gu, Charles Wang, and Jiuqiang Huang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.713019Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:5b04ce4929fda991cd0703e233539b12abcd8ea201920ca8d62d6645ec18f0dd","observation_id":"31e54323-2bdd-4f38-8adf-3d2c38cb5fb2","resolution":{"observed_at":"2026-08-15T20:41:57.713019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-15T20:41:57.735467Z","title":"Xinyun Ge and Torsten Hoefler","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.735467Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:f14d593d9f8cd1ef4a61d2529c646e6eec08aa672621438c04c2de81cd082809","observation_id":"2758c388-4eea-4f35-bccd-c27306f92bc6","resolution":{"observed_at":"2026-08-15T20:41:57.735467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13868","last_updated":"2024-07-21T11:42:32Z","snapshot_observed_at":"2026-08-18T04:31:13.008143Z","submitted_at":"2024-05-22T17:50:04Z","title":"Automatically Identifying Local and Global Circuits with Linear Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13868","snapshot_observed_at":"2026-08-15T20:41:57.746262Z","title":"Mor Geva, Roei Schuster, Jonathan Berant, and Omer Levy","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.746262Z"},"links":{"cited_paper":"/paper/2405.13868","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:a9fd9e3dfc2f6b95de459585060237dbce230f399256fa84de6dabe9bb8e8fe1","observation_id":"40a80de9-8fb3-432b-8930-313ba78f6b85","resolution":{"observed_at":"2026-08-15T20:41:57.746262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:58.651512Z","title":"A structural probe for finding syntax in word representations","venue":null,"work_id":"59e251bb-3f29-4e31-bfbd-9b5d3d9ff541","year":2019},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.756663Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:169c079ae5945b84fb8e4fd957955ad90eb4e05e5bb88b930d17ead068dd3142","observation_id":"97258de6-1dd7-4a72-bca0-e374b93edbb0","resolution":{"observed_at":"2026-08-15T20:41:58.658711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00873","last_updated":"2025-02-02T18:55:26Z","snapshot_observed_at":"2026-08-17T22:25:22.595447Z","submitted_at":"2025-02-02T18:55:26Z","title":"Language Models Use Trigonometry to Do Addition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00873","snapshot_observed_at":"2026-08-15T20:41:57.767445Z","title":"10 Jack Lindsey, Henry Cunningham, and Chris Olah","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.767445Z"},"links":{"cited_paper":"/paper/2502.00873","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:1afc92297de79ccf45f744decc17d503aa399e44ce08b2c454b09efc255be7ee","observation_id":"8b18c6d1-e4d3-41ad-83a0-82e88774668c","resolution":{"observed_at":"2026-08-15T20:41:57.767445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17677","last_updated":"2024-03-26T13:05:02Z","snapshot_observed_at":"2026-08-17T19:26:35.114752Z","submitted_at":"2024-03-26T13:05:02Z","title":"Onboard deep lossless and near-lossless predictive coding of hyperspectral images with line-based attention","version":1},"cited_work":{"arxiv_id":"2403.17677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.17677","snapshot_observed_at":"2026-08-15T20:41:58.340462Z","title":"Onboard deep lossless and near-lossless predictive coding of hyperspectral images with line-based attention","venue":"eess.IV","work_id":"726594a4-402c-437d-9ed5-becc452ceb16","year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.774976Z"},"links":{"cited_paper":"/paper/2403.17677","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:f73b42879c3f3dbda80294b15726d1d59b50846b2be0a0f76f9e69b934d7db72","observation_id":"1ffdf4d0-d5bb-4961-ac75-ea6d1f1ead9f","resolution":{"observed_at":"2026-08-15T20:41:58.347588Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-08-14T07:35:01.333549Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-15T20:41:57.783451Z","title":"Paul Michel, Omer Levy, and Graham Neubig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.783451Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:20586f7816b043185a63a0cf5c7417ee688ed22b9ca4758ad842bd92580f85b8","observation_id":"440a097c-656c-4f0f-a9a0-aa3c490c71ba","resolution":{"observed_at":"2026-08-15T20:41:57.783451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15054","last_updated":"2023-10-20T12:13:27Z","snapshot_observed_at":"2026-08-16T15:30:12.358828Z","submitted_at":"2023-05-24T11:43:47Z","title":"A Mechanistic Interpretation of Arithmetic Reasoning in Language Models using Causal Mediation Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15054","snapshot_observed_at":"2026-08-15T20:41:57.806134Z","title":"Moin Taufeeque, John Lynch, Mario Lucic, and Nicholas Frosst","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.806134Z"},"links":{"cited_paper":"/paper/2305.15054","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:0c97828d88fe7b177254f9557f01d5831389756ef424de815f4f08caf58f6195","observation_id":"51320bff-1c9a-453c-981e-44cee6b1c88d","resolution":{"observed_at":"2026-08-15T20:41:57.806134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15421","last_updated":"2025-05-30T00:08:56Z","snapshot_observed_at":"2026-08-16T13:32:14.673954Z","submitted_at":"2024-07-22T06:57:34Z","title":"Planning in a recurrent neural network that plays Sokoban","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15421","snapshot_observed_at":"2026-08-15T20:41:57.812580Z","title":"Alexander Templeton, Chris Olah, and Neel Nanda","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.812580Z"},"links":{"cited_paper":"/paper/2407.15421","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:94499e1ab49b2de087505b9581d03ebd7237831601245479ebaebe1cd1c7ebf4","observation_id":"d8059930-f293-4912-8a85-531183a2883b","resolution":{"observed_at":"2026-08-15T20:41:57.812580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06061","last_updated":"2024-06-10T07:18:24Z","snapshot_observed_at":"2026-08-19T02:51:48.299948Z","submitted_at":"2024-06-10T07:18:24Z","title":"Greedy SLIM: A SLIM-Based Approach For Preference Elicitation","version":1},"cited_work":{"arxiv_id":"2406.06061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06061","snapshot_observed_at":"2026-08-15T20:41:58.163843Z","title":"Greedy SLIM: A SLIM-Based Approach For Preference Elicitation","venue":"cs.IR","work_id":"603a8d86-a7a9-41f1-a0fa-707f03373ad2","year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.822374Z"},"links":{"cited_paper":"/paper/2406.06061","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:67cd9fb1a1a98ea31cacd0d5b41b18b65cfdfc24ffb50fd9b565b3fc67f2001e","observation_id":"a874f307-8349-43ce-af75-229ecd86002e","resolution":{"observed_at":"2026-08-15T20:41:58.180758Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16837","last_updated":"2025-05-31T11:20:49Z","snapshot_observed_at":"2026-08-17T19:25:01.286150Z","submitted_at":"2024-02-26T18:57:54Z","title":"Do Large Language Models Latently Perform Multi-Hop Reasoning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16837","snapshot_observed_at":"2026-08-15T20:41:57.829613Z","title":"Zeming Yu, Wenxuan Zhang, Jie Zhou, and Rui Cao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.829613Z"},"links":{"cited_paper":"/paper/2402.16837","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:c5ee5222b71f307a714540ac94cd94e6aeae10239c09a7f6e9df155dd7d468f4","observation_id":"0a511791-e9b3-46f4-a480-65a6d0a544fc","resolution":{"observed_at":"2026-08-15T20:41:57.829613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10835","last_updated":"2025-02-15T15:36:42Z","snapshot_observed_at":"2026-08-18T06:12:45.497411Z","submitted_at":"2025-02-15T15:36:42Z","title":"Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10835","snapshot_observed_at":"2026-08-15T20:41:57.837990Z","title":"Rui Zhang, Ziyang Liu, and Ge Fu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.837990Z"},"links":{"cited_paper":"/paper/2502.10835","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:d8aa85556cd3307bd7cb61bf5c804fc95621acb69df54e62a52f249b79985e65","observation_id":"0f918cea-6a9c-42de-bfe7-3316fd7c7214","resolution":{"observed_at":"2026-08-15T20:41:57.837990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09223","last_updated":"2024-10-11T19:57:55Z","snapshot_observed_at":"2026-08-16T16:19:38.327851Z","submitted_at":"2024-10-11T19:57:55Z","title":"The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09223","snapshot_observed_at":"2026-08-15T20:41:57.847407Z","title":"Wayne Xin Zhao, Kun Zhou, Junyi Li, Tianyi Tang, Xiaolei Wang, Yupeng Hou, Yingqian Min, Beichen Zhang, Junjie Zhang, Zican Dong, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.847407Z"},"links":{"cited_paper":"/paper/2410.09223","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:bc58b0839118e5e87a3482b82e85c156b3858a3b5e1c452df6fdcfd84c1ed365","observation_id":"0cd8144b-9469-465b-9e17-ea312c87ba26","resolution":{"observed_at":"2026-08-15T20:41:57.847407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03445","last_updated":"2024-06-05T16:40:53Z","snapshot_observed_at":"2026-08-16T13:45:48.818437Z","submitted_at":"2024-06-05T16:40:53Z","title":"Pre-trained Large Language Models Use Fourier Features to Compute Addition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03445","snapshot_observed_at":"2026-08-15T20:41:57.857103Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.857103Z"},"links":{"cited_paper":"/paper/2406.03445","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:8df2aeef3b704600fe21d4942d3c26f6655c28558c6be72d36dc43a8c738ed07","observation_id":"23e470d9-494f-4ca0-847e-47ff2cb4e4a5","resolution":{"observed_at":"2026-08-15T20:41:57.857103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T20:41:57.707058Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.707058Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:5d6e45ca5245a16adda760310cd89286953c0019615899391e1a61dd91b01bfd","observation_id":"80d84e79-42d6-4a6c-9b71-27d15d99acab","resolution":{"observed_at":"2026-08-15T20:41:57.707058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:57.798063Z","title":"Andrew Stolfo, Atticus Geiger, David Friedman, and Vivek Srikumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.798063Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:3ef98c1443bb9d112ff3c1b4649f798166ec272b3d6610d13a44b3837427aa76","observation_id":"5942f11e-34e8-4f12-9e3c-73ebb11e926f","resolution":{"observed_at":"2026-08-15T20:41:57.798063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:41:58.679351Z","title":"Lucy Gao, Lachlan Reynolds, Neel Nanda, and Chris Olah","venue":null,"work_id":"b756a16d-954c-46b0-9acb-8502f7273314","year":2021},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.723708Z"},"links":{"citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:8a3a6eb68628e3c2fc3431ad62c7fdd456267a2c524182339f7ae13fb55076ba","observation_id":"dbb3afd0-cdf1-4716-93ec-40fce452e4c0","resolution":{"observed_at":"2026-08-15T20:41:58.685822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04709","last_updated":"2025-05-08T23:00:37Z","snapshot_observed_at":"2026-08-16T16:03:00.653173Z","submitted_at":"2023-01-11T20:42:41Z","title":"Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04709","snapshot_observed_at":"2026-08-15T20:41:57.678412Z","title":"Transformer Circuits Thread","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.678412Z"},"links":{"cited_paper":"/paper/2301.04709","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:a8842bd5cc244f8bd0d3fe405c2ae54a7d272aa7936842d6305ded9e3e83d0ac","observation_id":"831539e5-aef9-43d1-9f5a-1fa53e94a015","resolution":{"observed_at":"2026-08-15T20:41:57.678412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12775","last_updated":"2024-10-14T09:55:12Z","snapshot_observed_at":"2026-08-16T13:41:45.691214Z","submitted_at":"2024-06-18T16:44:13Z","title":"Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12775","snapshot_observed_at":"2026-08-15T20:41:57.669378Z","title":"Thomas Bricken, Catherine Olsson, Matthew Ziegler, Nelson Elhage, Neel Nanda, and Chris Olah","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.669378Z"},"links":{"cited_paper":"/paper/2406.12775","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:8118bd746a7df93732b38323fab87c9af76b155d591d1abff45fde7584211e17","observation_id":"050025f9-5eb3-4283-b2e6-1356f1c0b97d","resolution":{"observed_at":"2026-08-15T20:41:57.669378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06346","last_updated":"2025-05-23T13:42:27Z","snapshot_observed_at":"2026-08-16T12:59:14.725250Z","submitted_at":"2025-01-10T21:18:21Z","title":"Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06346","snapshot_observed_at":"2026-08-15T20:41:57.686649Z","title":"Tristan Bush, Rohin Shah, and Jan Leike","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:57.686649Z"},"links":{"cited_paper":"/paper/2501.06346","citing_paper":"/paper/2505.12268"},"observation_digest":"sha256:a4902bb61db51a5cd4e4799c4b7fe6ab1b2d8b481231472e019e987de30a3842","observation_id":"051ef9ac-a2d4-4b48-a5ac-1d69ebca18c1","resolution":{"observed_at":"2026-08-15T20:41:57.686649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12268","last_updated":"2025-06-05T01:45:59Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T19:25:30.922752Z","submitted_at":"2025-05-18T07:15:01Z","title":"$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2505.12268."}