{"as_of":"2026-08-20T13:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9afb061eca86b03aa3dc9f442f5a63edb7f55578a9653a16ef62eaadb922d1f","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:19:44.485555Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:46:30.524426Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-07T14:46:30.524426Z","title":"Mib: A mechanistic interpretability benchmark, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17630","last_updated":"2026-06-01T15:02:22Z","snapshot_observed_at":"2026-08-17T22:04:21.144504Z","submitted_at":"2025-05-23T08:41:45Z","title":"Correcting Gradient-Based Circuit Localization via Interaction-Aware Backpropagation","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:46:30.524426Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2505.17630"},"observation_digest":"sha256:d10b36bcebbda3c62f3a0e2a00fccf34e26ca3ec9dc35079f6e837232d335bbf","observation_id":"6366d1e9-2358-4b4d-a9ef-ed0ae288c6f6","resolution":{"observed_at":"2026-08-07T14:46:30.524426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2605.12299","last_updated":"2026-05-12T15:52:30Z","snapshot_observed_at":"2026-08-14T22:35:48.833458Z","submitted_at":"2026-05-12T15:52:30Z","title":"GKnow: Measuring the Entanglement of Gender Bias and Factual Gender","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T04:50:43.547037Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2605.12299"},"observation_digest":"sha256:1e759a3d640cc00288da4f70bea759b594765da56be2289e2402a41d4cea9963","observation_id":"631dce06-3a98-4fb6-90c6-92421f0be3ce","resolution":{"observed_at":"2026-05-13T04:52:16.659440Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-14T20:53:40.666929Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:09aceda4f49ab9c9676079111f4f2922c5b856c0919ab50818d44575b80619bd","observation_id":"0380bb66-0e57-4391-a54d-9191c5e8e551","resolution":{"observed_at":"2026-05-14T20:59:28.649944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-15T04:59:11.877068Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:1df308dbefc5081a25899fa0d4effc6548f32ad73d5827ac1165a3474ca2a0b2","observation_id":"54662dba-3de8-42c9-b2ae-4e3f66a3b62e","resolution":{"observed_at":"2026-05-15T04:59:45.181193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":3},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-20T21:49:47.934339Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:a6cce16faf2e4efdd6526843412043f0b95eb4f49cf3b05ac272ab87b5aa1cd9","observation_id":"e5a8f98e-83c7-4617-9496-6f0468b548d8","resolution":{"observed_at":"2026-05-20T21:53:47.240269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2605.12770","last_updated":"2026-05-19T21:54:38Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T21:32:45Z","title":"WriteSAE: Sparse Autoencoders for Recurrent State","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T07:46:41.159688Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2605.12770"},"observation_digest":"sha256:c2657c6c6f51ff707e11fa0808bc4fc5afbf02bef44a6db67e1557e141d80c08","observation_id":"a4ace506-8545-4824-b27f-8caf6bb7ed2f","resolution":{"observed_at":"2026-05-21T07:49:50.228598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2605.21303","last_updated":"2026-05-20T15:33:14Z","snapshot_observed_at":"2026-08-15T04:38:16.754417Z","submitted_at":"2026-05-20T15:33:14Z","title":"From Circuit Evidence to Mechanistic Theory: An Inductive Logic Approach","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-21T06:01:36.610373Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2605.21303"},"observation_digest":"sha256:c81a32bcf8cbc67cadfebea5e51c3a3cd1f8499191c702620df94a192852833f","observation_id":"47aad02f-4569-4385-a330-036cf92d48ec","resolution":{"observed_at":"2026-05-21T06:03:59.212575Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:603db6ce6e1244e964ad41ebff65157714fc110029002bba80848ba9d4ada088","observation_id":"eb5dc46d-99ca-4240-893c-f772b8b110c3","resolution":{"observed_at":"2026-07-01T14:05:47.045442Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"Mib: A mechanistic interpretability benchmark, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:35156389f2e7aa0d0b89593e669c748d6b5fa74d82d2bbc748a308ac530680ed","observation_id":"c16647de-c97d-4f05-95fc-d49785494fdc","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2606.27981","last_updated":"2026-06-26T11:30:42Z","snapshot_observed_at":"2026-07-07T00:02:09.217954Z","submitted_at":"2026-06-26T11:30:42Z","title":"ToxiREX: A Dataset on Toxic REasoning in ConteXt","version":1},"reference_index":288,"source":"arxiv_source","source_observed_at":"2026-06-29T04:33:18.794505Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2606.27981"},"observation_digest":"sha256:fe4523ba36b5e46e5d1f1f52486d3fe07a29688fde6de00c5a5f120a7b78459f","observation_id":"4222ef77-f29b-4ed0-a020-dd1b420116c2","resolution":{"observed_at":"2026-06-29T04:43:07.056875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"cited_work":{"arxiv_id":"2504.13151","doi":"10.48550/arxiv.2504.13151","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13151","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Philipp Nazari and T","venue":"UvA-DARE (University of Amsterdam)","work_id":"81cbef43-20a2-48a0-bc12-92c9619867d9","year":2025},"citing_paper":{"arxiv_id":"2607.01940","last_updated":"2026-07-02T09:32:57Z","snapshot_observed_at":"2026-08-16T08:31:21.829577Z","submitted_at":"2026-07-02T09:32:57Z","title":"Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-03T17:31:22.683561Z"},"links":{"cited_paper":"/paper/2504.13151","citing_paper":"/paper/2607.01940"},"observation_digest":"sha256:464adf6a698de55b6a8deac22fc14b2f81ef84f394c544af5ea30238bb17ee5a","observation_id":"b7fbbf63-7d51-48b0-927c-cab0efac45f3","resolution":{"observed_at":"2026-07-03T17:38:43.457359Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13151/citation-record","integrity":"/paper/2504.13151/integrity","json":"/paper/2504.13151/citation-record.json","paper":"/paper/2504.13151"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.094644Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.094644Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:4cf7e931c964aac4b0b3f2f6005fb7b9801f6f3247641a195df8958d9ab633c6","observation_id":"674369d7-d84f-487f-beaa-02a27407f18e","resolution":{"observed_at":"2026-08-16T12:19:44.094644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.434265Z","title":"D., D'Oosterlinck, K., Feder, A., Gat, Y","venue":null,"work_id":"97ca7fec-7e2e-4de6-bebb-616524afd17f","year":2022},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.101547Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:5675e7d8a87c4e6b78a523809208e27f867829a9f9db14765054fe02ca684658","observation_id":"a5be7bd8-9474-4e1d-825c-1eab4f215b6a","resolution":{"observed_at":"2026-08-16T12:19:45.437930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.106861Z","title":"Naturalistic causal probing for morpho-syntax","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.106861Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:09ce3d84bc83837ab7d165bff97850a399783149e4b85b44f32671bc5cab7a59","observation_id":"a17374ba-4091-407d-9def-e6769eb67fcc","resolution":{"observed_at":"2026-08-16T12:19:44.106861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.111475Z","title":"Causal G ym: Benchmarking causal interpretability methods on linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.111475Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:cf8690c838152d0221218a4b41d3b7eb2e8a28cd0376195aa74495d93b4968b5","observation_id":"2fa739a7-e82a-4afd-b394-598ccfca6746","resolution":{"observed_at":"2026-08-16T12:19:44.111475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.116361Z","title":"G., and Augenstein, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.116361Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:007d77c013cf0fc6acc02913bc6c3dce953cc1bf4f2bb4e43bf45432a0e07c00","observation_id":"01cbd3b5-393a-461f-9159-7dc522c034b0","resolution":{"observed_at":"2026-08-16T12:19:44.116361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.423924Z","title":"E., Hume, T., Carter, S., Henighan, T., and Olah, C","venue":null,"work_id":"c56eca7b-f48e-4469-b289-3fc432aab97d","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.122079Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:4f3831948503bb4de60ba21bf707c3272bb25dc8cbc73a72040dbb30f26ca346","observation_id":"16fd34b1-ccb3-4864-9c57-c8b6369521ab","resolution":{"observed_at":"2026-08-16T12:19:45.427497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.126664Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.126664Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:59e736d270a4b3c34000b56d8eb8ae893c0cf66a0134def559c3c205756f0251","observation_id":"93ff46ae-35ab-47ac-846c-c5d852226093","resolution":{"observed_at":"2026-08-16T12:19:44.126664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.134591Z","title":"D., Schlichtkrull, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.134591Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:4d539ce80e4cedf2f1ab9d4c9a7eb5a2277417187b52545d4adf17080e3c5b43","observation_id":"b85ee3b9-aea6-423e-8014-aee498eda74f","resolution":{"observed_at":"2026-08-16T12:19:44.134591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.140323Z","title":"D., Schmid, L., Hupkes, D., and Titov, I","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.140323Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:d32fef67c7e9adca9d9a9902db0ecbd3ff5089f0f799d35514148f03aa0744cd","observation_id":"cafa9268-e036-453f-ae28-89af066c3c09","resolution":{"observed_at":"2026-08-16T12:19:44.140323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.146910Z","title":"Causal scrubbing, a method for rigorously testing interpretability hypotheses","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.146910Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:1e1199a700c20b4785d499c3af4b5eed432638df836151cde46a597f74e0a7a2","observation_id":"95b50249-2a8a-4d33-bd88-82c9678d0523","resolution":{"observed_at":"2026-08-16T12:19:44.146910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04478","last_updated":"2024-09-05T18:00:37Z","snapshot_observed_at":"2026-08-16T13:20:57.210034Z","submitted_at":"2024-09-05T18:00:37Z","title":"Evaluating Open-Source Sparse Autoencoders on Disentangling Factual Knowledge in GPT-2 Small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04478","snapshot_observed_at":"2026-08-16T12:19:44.152348Z","title":"and Geiger, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.152348Z"},"links":{"cited_paper":"/paper/2409.04478","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:1a5edcb24de26ee49ce53e6e65095b44f8e066260cbfa1377d87b426074050fa","observation_id":"ef87e1d5-8e18-4197-aa9f-d7899a7711c9","resolution":{"observed_at":"2026-08-16T12:19:44.152348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T12:19:44.157193Z","title":"Think you have solved question answering? T ry ARC , the AI2 R easoning C hallenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.157193Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:e3def7a032e9ab024cecd9f34266c171f75f3e67f195326dcc9a62900320d83a","observation_id":"454e5ae9-d5f6-4a31-822d-38d018706c9d","resolution":{"observed_at":"2026-08-16T12:19:44.157193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.161490Z","title":"Evaluating the ripple effects of knowledge editing in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.161490Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:9a965f132a6663e6fcfc49e62e52ac02af424933b736bd20e4ada71a0575780b","observation_id":"025ca9df-c481-4d15-ba75-0fcad7a4efae","resolution":{"observed_at":"2026-08-16T12:19:44.161490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.165647Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.165647Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:a1b7f9fe5703d661998df38864411d3a66822efb934acaf5d78c871ab17bc3a8","observation_id":"3d0d4a95-dee1-4586-a5e2-38e9c9bb54c0","resolution":{"observed_at":"2026-08-16T12:19:44.165647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.392959Z","title":"Are neural nets modular? I nspecting functional modularity through differentiable weight masks","venue":null,"work_id":"152bb13c-c15b-40c7-8e80-5dc0b65eba04","year":2021},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.169774Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:bf88fc7b9bfc289c3b47c42d99feae6f69da9662b9f3f5512ed8f985cac26d6a","observation_id":"4c891117-16f1-494d-83e8-14c797c37029","resolution":{"observed_at":"2026-08-16T12:19:45.396826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.382251Z","title":"D., and Geiger, A","venue":null,"work_id":"fff73540-f9fb-4f04-8fb6-fb397131ab97","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.174625Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:1cf54b98164b254574eecd258c684b4802de19275d89e15355fd14316cc4abd9","observation_id":"ab60f239-d8e0-4621-9aee-6d56a85db3bc","resolution":{"observed_at":"2026-08-16T12:19:45.385893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.179106Z","title":"Representational analysis of binding in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.179106Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:a222d9a712113f09c14189393bac7d53d0093c4c2c5f48ee5a917c41ffa0efb0","observation_id":"86eb13d8-49b5-4fa6-8a90-c4328d39b859","resolution":{"observed_at":"2026-08-16T12:19:44.179106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03637","last_updated":"2023-07-07T14:51:30Z","snapshot_observed_at":"2026-08-18T15:48:55.620724Z","submitted_at":"2023-07-07T14:51:30Z","title":"Discovering Variable Binding Circuitry with Desiderata","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03637","snapshot_observed_at":"2026-08-16T12:19:44.183284Z","title":"R., and Bau, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.183284Z"},"links":{"cited_paper":"/paper/2307.03637","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:ccf84392495de8b9fa10177d19bb62ce1ae09f348612637378324eb82eb77ad1","observation_id":"9e775a01-b83c-4e15-a867-5396a83a81e1","resolution":{"observed_at":"2026-08-16T12:19:44.183284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:19:44.188043Z","title":"The L lama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.188043Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:891af803f1743735468d1045db6ee0b8803e74460f4de0e2157898675ee625d2","observation_id":"81c66191-d82e-4b4c-bc30-4f7a22c119a5","resolution":{"observed_at":"2026-08-16T12:19:44.188043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.192154Z","title":"and Voita, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.192154Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:7cf7e8aa03ffbcf9caee9adff36fca43f57287353ab65860f9a6b4523c936a1c","observation_id":"4ff8a6b4-950a-4360-89a8-922232fa8346","resolution":{"observed_at":"2026-08-16T12:19:44.192154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-18T02:28:48.691668Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-16T12:19:44.196854Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.196854Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:9bb64a3abbdad0a2dd53142dd454b183eb56f5f2dd457996ceabc6b81dce8296","observation_id":"2cb92199-7342-4f6f-b00b-af85497cc4c4","resolution":{"observed_at":"2026-08-16T12:19:44.196854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.202047Z","title":"Causal analysis of syntactic agreement mechanisms in neural language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.202047Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:4dc8d5b68d8465d1dd1a71e8f24d4cfcd5685bdcb0065d6f0bc13d7a9a03a75b","observation_id":"b767b015-fce1-45bd-a0a0-6e26202630f3","resolution":{"observed_at":"2026-08-16T12:19:44.202047Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.206991Z","title":"Neural natural language inference models partially embed theories of lexical entailment and negation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.206991Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:a7fab614d5f0ed3628e0b6d5e053fb3f76f85b43aa6a5a4b6cfa5bde47e4d9e8","observation_id":"0e20172b-b8be-442d-a86a-924ebef1a8ec","resolution":{"observed_at":"2026-08-16T12:19:44.206991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.211407Z","title":"Causal abstractions of neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.211407Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:81953b07e53a2eeac0392cb1ead60dc1e462a366b32441ff6e5632c658d6d8cd","observation_id":"fcf78a62-d267-40a2-9454-b58de6ce52b1","resolution":{"observed_at":"2026-08-16T12:19:44.211407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04709","last_updated":"2025-05-08T23:00:37Z","snapshot_observed_at":"2026-08-16T16:03:00.653173Z","submitted_at":"2023-01-11T20:42:41Z","title":"Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04709","snapshot_observed_at":"2026-08-16T12:19:44.215403Z","title":"Causal abstraction: A theoretical foundation for mechanistic interpretability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.215403Z"},"links":{"cited_paper":"/paper/2301.04709","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:03915471206e6f433039e1820d35b71a9c2916fa9193e3e00a000641ae1b20c0","observation_id":"0d7cd494-b1de-4b9b-b4bd-199414ac0a7c","resolution":{"observed_at":"2026-08-16T12:19:44.215403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.363840Z","title":null,"venue":null,"work_id":"e4fc65e0-b699-4177-b49b-46f7285d3052","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.221212Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:b1df289b8a5d2386468de30546c4dff3fc5b24f2244f5ad028748cc501f39940","observation_id":"159477ae-8199-4e6c-a43d-f6747a5a828f","resolution":{"observed_at":"2026-08-16T12:19:45.367226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.353600Z","title":"Interp B ench: Semi-synthetic transformers for evaluating mechanistic interpretability techniques","venue":null,"work_id":"7656f2c0-2a4e-4e34-a0ca-cedd37ea7eda","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.226590Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:eb3d4825928d8e12d54d26b7dabf683d57a99f92f2fb81c09ae56f805d211dd8","observation_id":"67f1e680-6a0c-47d3-a9b6-b37b11327c18","resolution":{"observed_at":"2026-08-16T12:19:45.357306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.343133Z","title":"Have faith in faithfulness: Going beyond circuit overlap when finding model mechanisms","venue":null,"work_id":"5c7e7e59-138e-416a-a9c3-c1be334b17ca","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.231187Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:8bd078063dd6fc0787331798c1eb5cd52c2a5f589f5dc2ffa92bff57a4563658","observation_id":"e3a7e579-4ccd-442c-9b1a-1fe259cccea9","resolution":{"observed_at":"2026-08-16T12:19:45.347160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20526","last_updated":"2024-10-27T17:33:49Z","snapshot_observed_at":"2026-08-20T06:06:39.277314Z","submitted_at":"2024-10-27T17:33:49Z","title":"Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20526","snapshot_observed_at":"2026-08-16T12:19:44.235129Z","title":"Llama S cope: Extracting millions of features from llama-3.1-8b with sparse autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.235129Z"},"links":{"cited_paper":"/paper/2410.20526","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:dcc26ccc6b7c85573f570ac85745faaafdae3a3510b342892525362af12b30b6","observation_id":"3c8c3784-55e0-4e75-9d32-8e0e035ce8c9","resolution":{"observed_at":"2026-08-16T12:19:44.235129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07586","last_updated":"2025-02-11T14:34:05Z","snapshot_observed_at":"2026-08-15T18:36:57.349933Z","submitted_at":"2025-02-11T14:34:05Z","title":"We Can't Understand AI Using our Existing Vocabulary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07586","snapshot_observed_at":"2026-08-16T12:19:44.240029Z","title":"We can't understand AI using our existing vocabulary","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.240029Z"},"links":{"cited_paper":"/paper/2502.07586","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:e89d511949a20aaf5b1b75f87535e5779acd43a8ecdd1f1c2f63467a23d3151e","observation_id":"cd644efd-5788-419a-93ac-a7ec2fd61c91","resolution":{"observed_at":"2026-08-16T12:19:44.240029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.244630Z","title":"RAVEL : Evaluating interpretability methods on disentangling language model representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.244630Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:26a437530dd3be1ddcb2910998d16df1b2f9619d3c9b0b1741ce4d26c4fc5e22","observation_id":"a7658cd3-5c92-46fe-9528-9509ba5e4241","resolution":{"observed_at":"2026-08-16T12:19:44.244630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.331972Z","title":"Unified view of grokking, double descent and emergent abilities: A comprehensive study on algorithm task","venue":null,"work_id":"80d9d124-9cdd-4065-a8b3-bb15e4cb13bd","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.249555Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:daf2adcce6023dc21a8d7f70df666b0ff5d47f91f2716b3d86fabf10a619bff9","observation_id":"dd3b7a43-7c8d-4fad-81b7-f560faacd2fa","resolution":{"observed_at":"2026-08-16T12:19:45.335766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.253838Z","title":"R., Ewart, A., and Sharkey, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.253838Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:5e210f9f6fc8e497a6db72f21a3f1c97a158ac5be0bed0d01968b5824de642a6","observation_id":"ba885556-53cf-4d31-baae-1fa6f2581c70","resolution":{"observed_at":"2026-08-16T12:19:44.253838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T12:19:44.259346Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.259346Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:398b766039c777064f453e1daf075a06cf637f7a34097f96ac102f74e431c355","observation_id":"2b843f47-cb30-4d96-8fc5-11855fac63ec","resolution":{"observed_at":"2026-08-16T12:19:44.259346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00445","last_updated":"2022-05-01T11:01:28Z","snapshot_observed_at":"2026-08-17T19:53:31.995761Z","submitted_at":"2022-05-01T11:01:28Z","title":"MRKL Systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00445","snapshot_observed_at":"2026-08-16T12:19:44.264200Z","title":"MRKL systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.264200Z"},"links":{"cited_paper":"/paper/2205.00445","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:104f9bf662d58dc5b7cb3a6fd9b5499292287870761e7c99b9be611165b8ae10","observation_id":"9c3ceb61-fde3-4479-8660-b8ac8ed54565","resolution":{"observed_at":"2026-08-16T12:19:44.264200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.311224Z","title":"S A E B ench: A comprehensive benchmark for sparse autoencoders, 2025","venue":null,"work_id":"5ad11206-34bf-42ae-bca2-f61febd8d6ca","year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.269754Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:b5ed0516d7ae26f1dfe357dbd2389edc58e828bc16a6e771cb8c9776cf6862d1","observation_id":"6e592365-1c9a-4636-b610-6edcf208eac5","resolution":{"observed_at":"2026-08-16T12:19:45.316029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.299266Z","title":"and Janson, L","venue":null,"work_id":"04f0d85c-b4f3-4c8b-acef-0c4000477890","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.273862Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:edfdeae9a46226b4e00fbd5c4054d3762737a251d0d726764563ec16b539313a","observation_id":"3a193065-86e9-4816-bfa8-4f3f5cfcd559","resolution":{"observed_at":"2026-08-16T12:19:45.302802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03205","last_updated":"2025-05-30T20:24:51Z","snapshot_observed_at":"2026-08-19T23:23:40.310941Z","submitted_at":"2024-05-06T07:10:09Z","title":"Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03205","snapshot_observed_at":"2026-08-16T12:19:44.278545Z","title":"and Gao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.278545Z"},"links":{"cited_paper":"/paper/2405.03205","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:1e74846348d3b9641e50daf4bf6114dee1d349e31845872ee5272a2d4892d5e9","observation_id":"c350eff6-16c9-414e-b9a9-9ddc1a92f23b","resolution":{"observed_at":"2026-08-16T12:19:44.278545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09458","last_updated":"2023-07-24T08:32:40Z","snapshot_observed_at":"2026-08-16T15:15:14.602404Z","submitted_at":"2023-07-18T17:39:04Z","title":"Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09458","snapshot_observed_at":"2026-08-16T12:19:44.288268Z","title":"Does circuit analysis interpretability scale? evidence from multiple choice capabilities in chinchilla","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.288268Z"},"links":{"cited_paper":"/paper/2307.09458","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:5260fc8b6c1f2a032a79fbd0fedcee9c5cd3ac0eea32513b1576468386057980","observation_id":"b56e95c5-7fb8-4489-902b-13c1ded5124a","resolution":{"observed_at":"2026-08-16T12:19:44.288268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.292354Z","title":"Gemma S cope: Open sparse autoencoders everywhere all at once on G emma 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.292354Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:b9b57aa0b176729570fcd90577d758d2fa8d247a30484bcdb812f885bf81d577","observation_id":"c21ef519-b60e-4c89-a65e-d15845d80eee","resolution":{"observed_at":"2026-08-16T12:19:44.292354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.286805Z","title":"J., and Tegmark, M","venue":null,"work_id":"b3084d49-eb80-4aaa-8bac-7a447d7d894c","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.296230Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:b4b7dbdde1198a4d6b8c27750cbd104ad3f6f85f3ce692615ad14949ddf47c12","observation_id":"2910aa50-e957-464a-a09e-b15eb0c1cf74","resolution":{"observed_at":"2026-08-16T12:19:45.291289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.301616Z","title":"and Tegmark, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.301616Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:5941ede4c44db88a89c86a41310f4f55cf303a8ad16f51783bf5d0cb958611e9","observation_id":"0baac6ee-5c28-4dd0-8abf-5d619f2577de","resolution":{"observed_at":"2026-08-16T12:19:44.301616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.305937Z","title":"J., Belinkov, Y., Bau, D., and Mueller, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.305937Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:945cfece5f44695e9c24ff262763e3c57d7ccd9c6893da9c834c2ad2c5cca56f","observation_id":"e365039e-a2d8-4544-b83e-afe3d88d5f50","resolution":{"observed_at":"2026-08-16T12:19:44.305937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.310334Z","title":"J., and Belinkov, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.310334Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:a8171c18d677a895d88d31ff2ea2d1508de21bb2d7938a53f729eb6e9feaf324","observation_id":"5f9028d7-99f1-403d-b8c0-05f8ddd9c967","resolution":{"observed_at":"2026-08-16T12:19:44.310334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.253826Z","title":"Circuit component reuse across tasks in transformer language models","venue":null,"work_id":"bfcda11a-0c4f-470e-8e74-fa7cd9f41c1f","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.314615Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:c17a082bfbe7889c7c0ee09eb1101289efbbe91079a79ffcccbd7cc2924532ad","observation_id":"8347a5e6-4b61-4ee7-a6ec-8d22c4aadcef","resolution":{"observed_at":"2026-08-16T12:19:45.257719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.242379Z","title":"Transformer circuit evaluation metrics are not robust","venue":null,"work_id":"21e455f5-4ba1-4107-b6c6-6fad05a3dbac","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.318591Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:365a6632dbc6aff87a1c1ec04f0e156c1e2a1a086df5da0cd3fae9e3e5d40d75","observation_id":"88b197ba-be37-447b-a5c9-253da501e000","resolution":{"observed_at":"2026-08-16T12:19:45.246129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12747","last_updated":"2025-02-02T09:16:25Z","snapshot_observed_at":"2026-08-16T14:33:07.155507Z","submitted_at":"2023-12-20T03:44:18Z","title":"ALMANACS: A Simulatability Benchmark for Language Model Explainability","version":2},"cited_work":{"arxiv_id":"2312.12747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.12747","snapshot_observed_at":"2026-08-16T12:19:44.882355Z","title":"ALMANACS: A Simulatability Benchmark for Language Model Explainability","venue":"cs.LG","work_id":"c8742803-f093-4057-88cc-ff79d0b38607","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.322707Z"},"links":{"cited_paper":"/paper/2312.12747","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:5ca93de0aadffebefb3f1f8ad4f7ad29dff7e35131ad5e8571b169aff7a01a8e","observation_id":"fa9aeabb-d5a5-4bfd-b2f6-26e127fc5b48","resolution":{"observed_at":"2026-08-16T12:19:44.887552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.231221Z","title":"Missed causes and ambiguous effects: Counterfactuals pose challenges for interpreting neural networks","venue":null,"work_id":"fd8fd697-b31d-4b0b-b582-41006b307cdd","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.327378Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:e369ee4cb9b13111f337773f7c7915d856285ce4a228adbf69e1db9e63621ced","observation_id":"c055a362-2660-4f5e-bb09-28a5e43bac35","resolution":{"observed_at":"2026-08-16T12:19:45.235059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.332367Z","title":"S., Sun, J., Todd, E., Bau, D., and Belinkov, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.332367Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:22294b80de1bf6436301e6cb2b9fec11e99167fe8829b570e840286d93723c8c","observation_id":"bfbcb86d-4514-4b96-be4a-6b61d1c914f1","resolution":{"observed_at":"2026-08-16T12:19:44.332367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.218312Z","title":"Attribution Patching : Activation Patching At Industrial Scale , 2023","venue":null,"work_id":"b08840ba-84ec-49ef-b7f7-bfb88fef5bc3","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.338034Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:d60229f11efb50542d76bd74aaf7a276f3247ea747971aa9f3811b887a9513e6","observation_id":"cabedd9d-baae-48f7-bd64-1f0fe3171c7d","resolution":{"observed_at":"2026-08-16T12:19:45.222449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.342604Z","title":"Progress measures for grokking via mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.342604Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:2a281e213372c0958aab71deca3f039a7757c3a21e9aaa394176280fa83be321","observation_id":"d82fae5a-ff37-4040-a466-be814abc645e","resolution":{"observed_at":"2026-08-16T12:19:44.342604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.201008Z","title":"Arithmetic without algorithms: Language models solve math with a bag of heuristics","venue":null,"work_id":"443a4bc4-994b-4116-ba66-a09075d83873","year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.346598Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:a209dbbeef73e0bdf360362f18dd410bed4d4913f20e80f1e41f7c401218fa4d","observation_id":"af003af9-d57d-46c9-ae48-ebeee85d7c9d","resolution":{"observed_at":"2026-08-16T12:19:45.204428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.blackboxnlp-1.10","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.569465Z","title":null,"venue":null,"work_id":"1596564e-87d7-4d64-b4b7-1dbfd1365996","year":2021},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.351265Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:d952aa85db3c0e696e2d67cbe69ff5b802dd72e0316b80500bdb80970315137d","observation_id":"f7c2436a-759a-4d3d-93fc-2f73b73764ec","resolution":{"observed_at":"2026-08-16T12:19:44.575617Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.355595Z","title":"Zoom in: An introduction to circuits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.355595Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:8f253ed1329ff76c01a9797606a17aee98edc558256b58a269d50fa67cd35077","observation_id":"8a280f95-b32d-42ee-8efe-7172c061a9d1","resolution":{"observed_at":"2026-08-16T12:19:44.355595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.189806Z","title":"Chat GPT","venue":null,"work_id":"9de4bdbd-aaf1-4947-87d5-f6cdda6f0d60","year":2022},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.360286Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:c0f67d11be1577740bec6a49f35b764fb3c4ee8b94a530da8f4e25f1a1837525","observation_id":"afb3294d-a223-47c9-95fe-e7e1ccb215ea","resolution":{"observed_at":"2026-08-16T12:19:45.193351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.365711Z","title":"T he W orld of an O ctopus: H ow R eporting B ias I nfluences a L anguage M odel`s P erception of C olor","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.365711Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:480bb8bf850144aa26e245b19cc461afb00e02c6a7bea24738bb4bf1000a61d4","observation_id":"e467ff9b-46bf-45ea-810c-7a1577522a47","resolution":{"observed_at":"2026-08-16T12:19:44.365711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.370867Z","title":"Direct and indirect effects","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.370867Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:2fcfc37c542e99ebc5e721456e4cc6c3e770921a0356ac20e3e26b5770ae1cce","observation_id":"617d4acc-1f71-43d3-a42e-bf911c5566b2","resolution":{"observed_at":"2026-08-16T12:19:44.370867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.375601Z","title":"R., Haklay, T., Belinkov, Y., and Bau, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.375601Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:284a606eda7f4f02e8cf21fddf19c286fa2a6fb223d2b0f4d3ddf9f8e6e97b7c","observation_id":"bc420875-3adf-4312-85f4-9b7e819f0da7","resolution":{"observed_at":"2026-08-16T12:19:44.375601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.161548Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"aef22c71-1a59-40c6-94ce-d2bc0c6de9c9","year":2019},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.381041Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:5ce02dfd6119538b42cc77d1ba7e9dc28d051a3124a7647c5c9769f0796d0fec","observation_id":"0c5e45ca-ee17-459f-9526-0288e992fc1d","resolution":{"observed_at":"2026-08-16T12:19:45.166129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.385645Z","title":"Toward transparent AI: A survey on interpreting the inner structures of deep neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.385645Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:d989ce68a0af78aea26aeb228fe6f0dc6dfce2ff907694c354f1209ce25b0a3f","observation_id":"7cb43e06-e96b-4033-955b-29f703262ae3","resolution":{"observed_at":"2026-08-16T12:19:44.385645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-16T12:19:44.389775Z","title":"G., Hardin, C., Bhupatiraju, S., Hussenot, L., Mesnard, T., Shahriari, B., Ram \\'e , A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.389775Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:6ba7334f8967d6619e6241dfbd8685ffc9d1f5db00ee0b50dd7d918e5452595b","observation_id":"6cfe65e8-a641-4b35-a9be-8708ea59b0b0","resolution":{"observed_at":"2026-08-16T12:19:44.389775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.394397Z","title":"and Wiegreffe, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.394397Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:1cbe79a9e4d415c45cd2ce9ea887c6bc0b7a3833d4af1655dd4889f6b9187f48","observation_id":"8af88365-fba6-440a-8db8-8c2c9d5d63be","resolution":{"observed_at":"2026-08-16T12:19:44.394397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.140078Z","title":"R., Materzynska, J., Chowdhury, N., Li, S., Andreas, J., Bau, D., and Torralba, A","venue":null,"work_id":"ef515575-fc68-45e4-9e05-34d4d3f1cd34","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.398080Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:3f0e3b8afad1557076507d8126dd09cfbbc0be27a24580b17cf685e6c4573cb2","observation_id":"b335c0b4-7620-42a0-a07d-a8875fc54da3","resolution":{"observed_at":"2026-08-16T12:19:45.144937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-16T12:19:44.403261Z","title":"J., Casper, S., Tegmark, M., Saunders, W., Bau, D., Todd, E., Geiger, A., Geva, M., Hoogland, J., Murfet, D., and McGrath, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.403261Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:8fe0911363f4fae9a66b61d04e6423db60046ce4896eb1d1576840d3be8200fa","observation_id":"bafc4f95-d018-43e8-b457-ab7e7916768d","resolution":{"observed_at":"2026-08-16T12:19:44.403261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.127829Z","title":"Hypothesis testing the circuit hypothesis in LLM s","venue":null,"work_id":"a2c61aa7-b129-4ae3-a3ed-2ab98fa05146","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.408434Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:0e8064c9df78e3ee2d508ac34dfe956e19c8452c2511a0c9324e61ddd74afc37","observation_id":"2024cd65-c2f0-42b4-9238-235e5decdc44","resolution":{"observed_at":"2026-08-16T12:19:45.131791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.116504Z","title":"Neural and conceptual interpretation of PDP models","venue":null,"work_id":"a91becea-463d-4475-9262-a62d87b42541","year":1986},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.413534Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:80395b7691004a9db8bcd6fcc81f62c4cddb176fc34aaeb5e94c4110b276b826","observation_id":"4be3bb3c-596e-41ff-8f4c-73844cad5954","resolution":{"observed_at":"2026-08-16T12:19:45.120559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.103642Z","title":"A mechanistic interpretation of arithmetic reasoning in language models using causal mediation analysis","venue":null,"work_id":"9d1a1ab5-2ffe-4f9e-b293-d0da1cd00d6b","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.417522Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:154a714328afe4faec2e24df6e83fa2c38dac33f4302ebc89bddb4cd5f695321","observation_id":"8b01a9d3-50db-44e1-9ef4-df33b7827098","resolution":{"observed_at":"2026-08-16T12:19:45.107760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.091493Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":"e5c95ec6-a96c-44d7-a8e2-90cc2c6049fa","year":2017},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.421388Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:b2da918d0d19893f0601f21b050332b39165ccd6fcf1c722ab11e0fb3a24f562","observation_id":"4e9c196b-b341-4acd-9a35-ed535fcaf0b0","resolution":{"observed_at":"2026-08-16T12:19:45.095897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.425522Z","title":"Attribution patching outperforms automated circuit discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.425522Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:b1d9a0d7fa3197ead35c33eafa8f3345075b216dc8c29d7468da4e37faafe73b","observation_id":"a48464b1-6400-44eb-81ac-bd3f8865dbf6","resolution":{"observed_at":"2026-08-16T12:19:44.425522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-08-08T01:44:57.952179Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-16T12:19:44.431272Z","title":"J., Geiger, A., and Nanda, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.431272Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:07249dc46b08b1ee44ab8b8617dd56bb25ebba03b1a9556eaf87598a006e3643","observation_id":"00e92e82-b680-43db-8b5b-562772f559fd","resolution":{"observed_at":"2026-08-16T12:19:44.431272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.435562Z","title":"Investigating gender bias in language models using causal mediation analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.435562Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:ac547327b08fa1d989b5a799dde851cc244bcae176040f519c22f7efe8fc1a32","observation_id":"58d770e9-5288-47a9-a52e-95f406d24dd5","resolution":{"observed_at":"2026-08-16T12:19:44.435562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.065938Z","title":"R., Variengien, A., Conmy, A., Shlegeris, B., and Steinhardt, J","venue":null,"work_id":"35196801-3161-4b8e-978a-a76c4705351a","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.440347Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:5502f5afcc96d53bdd162bf821016242bc4b8ff50647a74c729feb1954419028","observation_id":"4622cb2e-3eb5-48f1-97fc-3ea60751501d","resolution":{"observed_at":"2026-08-16T12:19:45.072195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.044573Z","title":"Answer, assemble, ace: Understanding how LM s answer multiple choice questions","venue":null,"work_id":"8e4f0436-a09e-4aed-95f9-a144c959e7b6","year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.445962Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:09b7cb2700e857011f4288d837552ba43555865dc1e087be898b424ad0ac1ac8","observation_id":"d145f84b-072e-461d-9725-16ea5ef63ab7","resolution":{"observed_at":"2026-08-16T12:19:45.051671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.030395Z","title":null,"venue":null,"work_id":"84710809-1154-4e33-9a68-52ffa285a192","year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.451531Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:0a6d43b48bf065d656025fda61fadb74e4efc17cef877c6afb501e86ecd1227e","observation_id":"4a6add0d-85b1-4107-8ff1-40ae29e543c3","resolution":{"observed_at":"2026-08-16T12:19:45.033726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:45.016985Z","title":"D., and Potts, C","venue":null,"work_id":"984a72b0-3241-431d-b0d8-e526f1169c62","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.457623Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:d04e047b8c43ca35b1ebdd5f6cab705f2c2dd6bb6979c5ba1efbfcd862f414d1","observation_id":"a23db8f0-df8a-41c6-8786-2add4f54c01e","resolution":{"observed_at":"2026-08-16T12:19:45.021012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17148","last_updated":"2025-03-03T21:15:30Z","snapshot_observed_at":"2026-08-18T17:43:57.196434Z","submitted_at":"2025-01-28T18:51:24Z","title":"AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17148","snapshot_observed_at":"2026-08-16T12:19:44.465708Z","title":"D., and Potts, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.465708Z"},"links":{"cited_paper":"/paper/2501.17148","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:9db2d698880e5fcffb535ca005b3f36111efa3516ead33eea44475bda1d912e2","observation_id":"e4670055-fc91-487f-9650-02c24615c8a9","resolution":{"observed_at":"2026-08-16T12:19:44.465708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T12:19:44.471525Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.471525Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:2c93505544eed83a642eb77e66b836c3aa4daf974b61b3a1edd0cb20221b6e49","observation_id":"810c448a-957f-4077-be25-c39aa297cc9e","resolution":{"observed_at":"2026-08-16T12:19:44.471525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.476379Z","title":"and Nanda, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.476379Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:f01d8ea93a99468e97acb0d844ccb5cf4df139f3a5194dd1c71c10b401b7a379","observation_id":"1c8f33e0-d25e-4d84-98eb-68b458c52098","resolution":{"observed_at":"2026-08-16T12:19:44.476379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.995620Z","title":"Interpreting and improving large language models in arithmetic calculation","venue":null,"work_id":"c76c5511-8303-4f5a-87ff-3adf79a19451","year":2024},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.480799Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:3cc27eb69f3ff227b438d9d7b2a3f7c0173ce6151690cb9de783645867299f97","observation_id":"0216a669-8cd6-4d19-80de-143332625da7","resolution":{"observed_at":"2026-08-16T12:19:45.000056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:44.485555Z","title":"MQ u AKE : Assessing knowledge editing in language models via multi-hop questions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T12:19:44.485555Z"},"links":{"citing_paper":"/paper/2504.13151"},"observation_digest":"sha256:dce5acf3733da0e92f01d00d800e6e64b94a48798f48382a91efbaaea0acf287","observation_id":"e8690118-a74a-46bd-b5af-241c19b7936e","resolution":{"observed_at":"2026-08-16T12:19:44.485555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13151","last_updated":"2025-06-09T17:44:50Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T22:04:07.354628Z","submitted_at":"2025-04-17T17:55:45Z","title":"MIB: A Mechanistic Interpretability Benchmark"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 11 inbound Pith citation observations for arXiv:2504.13151."}