{"as_of":"2026-08-10T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aea2a093ad57d7ef545779f8a4b3373a949f82f9f9735cbba237706fab5012dc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:32:50.043146Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-10T14:32:50.043146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15225","last_updated":"2025-06-23T15:24:16Z","snapshot_observed_at":"2026-08-10T14:27:06.207702Z","submitted_at":"2025-01-25T14:09:39Z","title":"SEAL: Scaling to Emphasize Attention for Long-Context Retrieval","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T14:32:50.043146Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2501.15225"},"observation_digest":"sha256:3d105ca4e3cafc96caf67446cfad1b1d2f54589b5809acb64626a9c664fe3684","observation_id":"4c290d7f-f079-48b8-848c-2dcec4755adb","resolution":{"observed_at":"2026-08-10T14:32:50.043146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-07T12:25:31.903456Z","title":"A primer on the inner workings of transformer-based language models.arXiv preprint arXiv:2405.00208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24539","last_updated":"2026-07-28T16:02:36Z","snapshot_observed_at":"2026-08-07T14:30:36.260777Z","submitted_at":"2025-05-30T12:46:44Z","title":"Localizing Persona Representations in LLMs","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:31.903456Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2505.24539"},"observation_digest":"sha256:08d2ec3b257db7f5d294f36de1956972f6c6a36329e7ad8bf3b36cb1f5bcbda1","observation_id":"cd891a5e-fdcc-4edc-aee8-29bd0f28be5b","resolution":{"observed_at":"2026-08-07T12:25:31.903456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-07T12:00:20.644602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00829","last_updated":"2025-06-03T16:03:55Z","snapshot_observed_at":"2026-08-10T07:05:07.164947Z","submitted_at":"2025-06-01T04:26:46Z","title":"COMPKE: Complex Question Answering under Knowledge Editing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:00:20.644602Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2506.00829"},"observation_digest":"sha256:4f7749eeaa6c632641fba78abcec24bcd8d8d9560d7d573fa31d61a1a454ac09","observation_id":"ff9321fb-f648-45d5-911f-03a2f7b310df","resolution":{"observed_at":"2026-08-07T12:00:20.644602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-07T11:32:41.614831Z","title":"Costa-jussà","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02172","last_updated":"2025-06-02T18:58:41Z","snapshot_observed_at":"2026-08-10T11:02:16.672548Z","submitted_at":"2025-06-02T18:58:41Z","title":"Different Speech Translation Models Encode and Translate Speaker Gender Differently","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:41.614831Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2506.02172"},"observation_digest":"sha256:5cc5ca9f50976deed8ba1fa82636f11cbe73269a18eb39fb0f60b15a82b40cdd","observation_id":"5d965c15-1fd4-4e84-95fd-5844c1471ab9","resolution":{"observed_at":"2026-08-07T11:32:41.614831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-07T05:19:30.100608Z","title":"A primer on the inner workings of transformer-based language models.arXiv preprint arXiv:2405.00208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08359","last_updated":"2026-07-13T06:33:40Z","snapshot_observed_at":"2026-08-08T00:02:40.624808Z","submitted_at":"2025-06-10T02:16:50Z","title":"REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:30.100608Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2506.08359"},"observation_digest":"sha256:b7ac06d45924ee433a9548a3a747433adc28645ecb7e4239d759b2512bb95c29","observation_id":"a7746e88-e267-4a16-ab21-a2c6f35cccb0","resolution":{"observed_at":"2026-08-07T05:19:30.100608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-07T05:27:08.613581Z","title":"Costa-jussà","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10024","last_updated":"2025-06-09T17:57:43Z","snapshot_observed_at":"2026-08-09T19:26:08.293354Z","submitted_at":"2025-06-09T17:57:43Z","title":"Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:27:08.613581Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2506.10024"},"observation_digest":"sha256:073bd65a0b48344f023469a809ca334a7b37db7313d3584b7f195684ea9264c4","observation_id":"d039dfbb-1351-4c27-869b-4fa661590064","resolution":{"observed_at":"2026-08-07T05:27:08.613581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-06T21:26:12.059928Z","title":"Costa-jussà","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00152","last_updated":"2025-06-30T18:04:36Z","snapshot_observed_at":"2026-08-08T00:40:32.050938Z","submitted_at":"2025-06-30T18:04:36Z","title":"Table Understanding and (Multimodal) LLMs: A Cross-Domain Case Study on Scientific vs. Non-Scientific Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:26:12.059928Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2507.00152"},"observation_digest":"sha256:4501b69f975c11481ee7c4fae9dd8e8dcf284d85bfbc3ed94f3c036f6f2645e3","observation_id":"969dbf6a-d78c-4991-b7cc-d00e476c2663","resolution":{"observed_at":"2026-08-06T21:26:12.059928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-06T19:53:37.628279Z","title":"arXiv preprint arXiv:2405.00208 (Apr 2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04432","last_updated":"2025-07-06T15:35:45Z","snapshot_observed_at":"2026-08-10T08:05:43.250624Z","submitted_at":"2025-07-06T15:35:45Z","title":"Reconstructing Biological Pathways by Applying Selective Incremental Learning to (Very) Small Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:53:37.628279Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2507.04432"},"observation_digest":"sha256:341f13d2276a67496f50482758fef85e70742eec25f81570a3d8e7a91211fbda","observation_id":"a7107925-66e7-4d5e-939b-6ac8c480cc71","resolution":{"observed_at":"2026-08-06T19:53:37.628279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-06T16:19:52.229487Z","title":"A primer on the inner workings of transformer-based language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13858","last_updated":"2025-07-18T12:23:47Z","snapshot_observed_at":"2026-08-08T06:10:45.567459Z","submitted_at":"2025-07-18T12:23:47Z","title":"InTraVisTo: Inside Transformer Visualisation Tool","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:19:52.229487Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2507.13858"},"observation_digest":"sha256:dbeb2538cb1a26e94cf9c615b79093bd96389fdde0bc1a40bb8cc1e67eff5ca1","observation_id":"33e50dca-6d09-4305-be81-0a65a7de62a0","resolution":{"observed_at":"2026-08-06T16:19:52.229487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-04T15:52:06.284744Z","title":"A primer on the inner workings of transformer-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.18010","last_updated":"2026-06-22T14:35:25Z","snapshot_observed_at":"2026-08-06T04:50:51.070686Z","submitted_at":"2025-09-22T16:49:26Z","title":"Cross-Attention is Half Explanation in Speech-to-Text Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T15:52:06.284744Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2509.18010"},"observation_digest":"sha256:10e103237b621a58fe0a3a0ee6a562d51e05db373ad3009eb25a9880d3acd590","observation_id":"6360b106-6c69-4543-bebd-268732f5067c","resolution":{"observed_at":"2026-08-04T15:52:06.284744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2509.18127","last_updated":"2026-04-14T10:00:44Z","snapshot_observed_at":"2026-08-02T17:25:00.233548Z","submitted_at":"2025-09-11T11:22:43Z","title":"Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T18:13:01.662828Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2509.18127"},"observation_digest":"sha256:cbfdc92c01de383c4e6b602ba82187c061fa25770ac786c131cc7b8ef1a15d72","observation_id":"ae9637fe-1be0-4efa-9434-4a352bf193e0","resolution":{"observed_at":"2026-05-18T18:16:43.774882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-04T10:40:26.442823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09340","last_updated":"2026-06-30T16:53:02Z","snapshot_observed_at":"2026-08-10T12:16:08.152649Z","submitted_at":"2025-10-10T12:49:00Z","title":"Deductive Logic in Language Models: Horizontal vs Vertical Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:26.442823Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2510.09340"},"observation_digest":"sha256:b4510feda6d462c5c005d5fa1e5c7368f7837e88f2a7d5312ced6875700c524e","observation_id":"4dd6da5a-0fac-4782-889b-93e2cb759d3b","resolution":{"observed_at":"2026-08-04T10:40:26.442823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-04T09:08:54.428626Z","title":"A Primer on the Inner Workings of Transformer-based Language Models.arXiv preprint arXiv:2405.00208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17256","last_updated":"2026-06-03T19:38:37Z","snapshot_observed_at":"2026-08-08T10:07:33.427560Z","submitted_at":"2025-10-20T07:43:53Z","title":"Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:54.428626Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2510.17256"},"observation_digest":"sha256:4e8f656a240bb6864bb0c0312c6017dd4dafa65894d3082c9f42b9a7a77b65b1","observation_id":"f1af8c93-d940-408c-9025-3865fb76a609","resolution":{"observed_at":"2026-08-04T09:08:54.428626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-03T14:02:56.666237Z","title":"A primer on the inner workings of transformer-based language models.arXiv preprint arXiv:2405.00208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.22088","last_updated":"2026-06-10T15:31:41Z","snapshot_observed_at":"2026-08-09T06:43:58.919201Z","submitted_at":"2025-12-26T17:20:09Z","title":"Unifying Learning Dynamics and Generalization in Transformers Scaling Law","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:02:56.666237Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2512.22088"},"observation_digest":"sha256:8f3bd572599c78c2604488bdc50d7365405a75170bf6a9309e23f7937e9ccbf7","observation_id":"11c8130f-c5be-4e8d-8cab-00bd528aee42","resolution":{"observed_at":"2026-08-03T14:02:56.666237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-31T09:24:49.481740Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:d0818b4f6204cd919c69716a816808bf8262c4c01ec35c8716940e0cfb3ff6a0","observation_id":"f53c37eb-ce5e-4382-a38d-c96bc8906a9a","resolution":{"observed_at":"2026-05-16T12:40:54.748973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-02T22:39:09.674583Z","title":"arXiv:2405.00208 [cs.CL] https://arxiv.org/abs/2405.00208","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16299","last_updated":"2026-07-06T07:51:55Z","snapshot_observed_at":"2026-08-09T07:24:27.924510Z","submitted_at":"2026-02-18T09:30:29Z","title":"MICE: Minimal Interaction Cross-Encoders for efficient Re-ranking","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:39:09.674583Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2602.16299"},"observation_digest":"sha256:aee8082cac2825a8678ff18600aec1d4492ae2ca30d09cd1d5132b630f7f1a54","observation_id":"09abdd37-4ecf-4c6e-83e9-0eb4e5e2abb6","resolution":{"observed_at":"2026-08-02T22:39:09.674583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2602.16608","last_updated":"2026-05-19T23:05:11Z","snapshot_observed_at":"2026-08-08T15:26:08.027438Z","submitted_at":"2026-02-18T17:03:10Z","title":"Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T12:46:59.419162Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2602.16608"},"observation_digest":"sha256:013a5af06cc3a5c8448c96357d2c7b34ca4d909aa6e16312bb058e3ed48826d0","observation_id":"026ccf86-4225-4276-8128-7c829353877f","resolution":{"observed_at":"2026-05-21T12:50:09.275117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2604.06356","last_updated":"2026-04-07T18:35:47Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:35:47Z","title":"In-Context Learning in Speech Language Models: Analyzing the Role of Acoustic Features, Linguistic Structure, and Induction Heads","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T20:14:21.150863Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2604.06356"},"observation_digest":"sha256:eef89158498b2a96414149e9f8bc53d01b18f974f061856cdfad6ed5536877b7","observation_id":"10668668-0420-40c4-98e8-0eed8aa1a1cf","resolution":{"observed_at":"2026-05-10T22:05:49.019611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2604.07019","last_updated":"2026-04-08T12:37:39Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T12:37:39Z","title":"ConceptTracer: Interactive Analysis of Concept Saliency and Selectivity in Neural Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:13:21.974912Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2604.07019"},"observation_digest":"sha256:7e28a5d17f0e5a1964dd10172995bd26eaf1eff8aa572a4219f6199319d406fb","observation_id":"83663496-d765-4e1c-a429-25342bb7063c","resolution":{"observed_at":"2026-05-10T23:20:51.372895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2604.17761","last_updated":"2026-04-20T03:24:11Z","snapshot_observed_at":"2026-08-04T06:40:12.598546Z","submitted_at":"2026-04-20T03:24:11Z","title":"Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:12:31.218055Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2604.17761"},"observation_digest":"sha256:430c12bdd416f5bcae0f571c0ea4aa359453eac5d74e185b8fa31fe1383770aa","observation_id":"25a79f0f-dd89-4954-bebd-aff1becd1fab","resolution":{"observed_at":"2026-05-10T09:38:42.816884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.04177","last_updated":"2026-05-05T18:14:59Z","snapshot_observed_at":"2026-07-09T23:16:44.047024Z","submitted_at":"2026-05-05T18:14:59Z","title":"Are LLMs Ready for Conflict Monitoring? Empirical Evidence from West Africa","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-08T17:48:51.792769Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.04177"},"observation_digest":"sha256:c5b41f1fdd70a94ee3028ccc9ebbc15b2c3ae7f724403b9ad0fb99f73c675715","observation_id":"c562ffef-6152-4ae4-b75a-74d28d7c9c9d","resolution":{"observed_at":"2026-05-11T17:11:18.021348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.09129","last_updated":"2026-05-09T19:20:57Z","snapshot_observed_at":"2026-08-02T09:24:59.983230Z","submitted_at":"2026-05-09T19:20:57Z","title":"Data-driven Circuit Discovery for Interpretability of Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T02:19:45.010301Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.09129"},"observation_digest":"sha256:e0702a7d93685bfb7953719e3a8a47075f76d5c5f72f388967a0168309375b91","observation_id":"6cc7a763-e24b-4086-b8fd-81fcb49e69ec","resolution":{"observed_at":"2026-05-12T02:21:16.662417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.11093","last_updated":"2026-05-11T18:01:36Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:01:36Z","title":"Enabling Performant and Flexible Model-Internal Observability for LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:17:13.823853Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.11093"},"observation_digest":"sha256:9d94ebc1c3f3ca95c8f8a9ef7d776995e5b26d36c51fec520a26642a2f88562d","observation_id":"3ee19c8b-1c38-4afc-a82f-f9003397b20b","resolution":{"observed_at":"2026-05-13T07:17:28.083335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.11206","last_updated":"2026-05-13T08:57:14Z","snapshot_observed_at":"2026-08-05T18:10:32.435834Z","submitted_at":"2026-05-11T20:21:04Z","title":"Instructions Shape Production of Language, not Processing","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-13T03:09:02.902912Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.11206"},"observation_digest":"sha256:04b8dd619685b44152c4d5d441453c7b6cf9926886144bc0b1154cd4118d0f38","observation_id":"f714c5e2-0d39-4939-a70c-b660c5e12355","resolution":{"observed_at":"2026-05-13T03:12:09.296748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.11206","last_updated":"2026-05-13T08:57:14Z","snapshot_observed_at":"2026-08-05T18:10:32.435834Z","submitted_at":"2026-05-11T20:21:04Z","title":"Instructions Shape Production of Language, not Processing","version":2},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-14T21:02:02.135970Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.11206"},"observation_digest":"sha256:c7f89d1ab33c9823407f1e92ff9ffb5df2276504747746ef1641d12be7b59681","observation_id":"d957face-3a0b-471f-9aa8-effa8058e3e4","resolution":{"observed_at":"2026-05-14T21:02:58.204816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:8c1bb0023ee317bdf13cddb120d12cc7f4531a29cfcb365ae3dba7ba35cc3d35","observation_id":"d20cb649-d16e-429e-8140-99aecf524e17","resolution":{"observed_at":"2026-05-13T05:22:18.929668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.14075","last_updated":"2026-05-13T19:51:25Z","snapshot_observed_at":"2026-08-02T01:26:29.339562Z","submitted_at":"2026-05-13T19:51:25Z","title":"Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-15T05:05:01.099084Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.14075"},"observation_digest":"sha256:b21268db2584081350454f7b9bb9576bf44373a9b932f3f195bb33e5d376fa67","observation_id":"676e7e43-ddd8-49e9-8fcd-52512a69dd4c","resolution":{"observed_at":"2026-05-15T05:09:44.376483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.22532","last_updated":"2026-05-23T09:13:45Z","snapshot_observed_at":"2026-08-02T17:55:32.280248Z","submitted_at":"2026-05-21T14:22:27Z","title":"Relational Linear Properties in Language Models: An Empirical Investigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:09.743615Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.22532"},"observation_digest":"sha256:4a922fcc0e3e68779af1133b0825bef0d6ef9a9eeadde8d7990ba0396d73b062","observation_id":"6e249306-266e-478a-ac6b-c035aa77ec84","resolution":{"observed_at":"2026-05-22T07:46:14.986084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2605.22532","last_updated":"2026-05-23T09:13:45Z","snapshot_observed_at":"2026-08-02T17:55:32.280248Z","submitted_at":"2026-05-21T14:22:27Z","title":"Relational Linear Properties in Language Models: An Empirical Investigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T17:13:03.620676Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2605.22532"},"observation_digest":"sha256:2d87986bb39285c41e75c5b1df2778222ad369aa3d949efae9100fc58a26b11f","observation_id":"d9ed1830-ba6f-45ca-8190-44260ed1cec7","resolution":{"observed_at":"2026-06-30T17:14:56.759886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2606.03085","last_updated":"2026-06-02T03:15:35Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:15:35Z","title":"Multi-component Causal Tracing in Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T11:52:24.954950Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2606.03085"},"observation_digest":"sha256:87d692cb52b5dfc1f196c11ca57e1559af752b9aa6cf7348daabcd5189942bd9","observation_id":"98d98515-5b4a-422d-aa76-daff08a04ab8","resolution":{"observed_at":"2026-07-02T01:36:24.919128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:5e90fd421e11a49b215740e87b3e29e02aab3813baed2b63238878e9d5b114c4","observation_id":"8a866893-c40e-4719-84fb-e708dbbc3f9e","resolution":{"observed_at":"2026-06-28T23:32:46.752725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:f3bf1eb69c6ba4062049038dfca02e92ce89c2ff1c1ee9324246313400469c7d","observation_id":"aa70353b-9fe2-4354-843f-4502b7615ab5","resolution":{"observed_at":"2026-06-28T23:32:47.304588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2606.09466","last_updated":"2026-06-09T09:48:08Z","snapshot_observed_at":"2026-08-07T14:01:37.853419Z","submitted_at":"2026-06-08T13:21:42Z","title":"DECSELFMASK: Leveraging Unlabeled Text via Self-Relevance-Guided Masking for Decoder-Only Classification","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:36:10.784902Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2606.09466"},"observation_digest":"sha256:fb9e925897a50b4d80e58e5160939c80aab3a5f067b429f51d70c5f353c4ffb7","observation_id":"17b1d4fc-ca74-41a8-81d9-4e6feb7269e5","resolution":{"observed_at":"2026-07-03T01:27:30.553886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2606.24026","last_updated":"2026-06-23T00:04:31Z","snapshot_observed_at":"2026-08-02T11:37:58.639463Z","submitted_at":"2026-06-23T00:04:31Z","title":"Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T00:47:00.310205Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2606.24026"},"observation_digest":"sha256:4cf9f7e55b3f1ceaa0b516fdb267e8c2deeca1e62132a01fa75945375a39f6fc","observation_id":"630106ce-c732-46c8-a961-19f73307ba2a","resolution":{"observed_at":"2026-07-04T16:19:57.641510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":"2405.00208","doi":"10.48550/arxiv.2405.00208","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferrando, G","venue":"arXiv (Cornell University)","work_id":"e2a1ac9c-a52e-4b96-8aea-1eb401e09698","year":2024},"citing_paper":{"arxiv_id":"2607.00012","last_updated":"2026-05-08T10:35:13Z","snapshot_observed_at":"2026-08-04T21:03:13.172809Z","submitted_at":"2026-05-08T10:35:13Z","title":"PRA-RAG: Provably Robust Aggregation in Retrieval-Augmented Generation against Retrieval Corruption","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-02T23:42:23.695930Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2607.00012"},"observation_digest":"sha256:2e1ff2dd65f76e8a2bf26c22ad7f5c152c09ebe1235b102aadef526e80d03b58","observation_id":"6489dc32-5b72-4f04-a3da-eb0acccce6a4","resolution":{"observed_at":"2026-07-02T23:47:27.188119Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00208","snapshot_observed_at":"2026-07-14T09:09:29.470093Z","title":"A Primer on the Inner Workings of Transformer-based Language Models.arXiv preprint arXiv:2405.00208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10803","last_updated":"2026-07-12T15:21:19Z","snapshot_observed_at":"2026-08-09T18:25:10.447410Z","submitted_at":"2026-07-12T15:21:19Z","title":"Weight-Adjusted Gradients Reveal Parameter Importance and Failure Modes in LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T09:09:29.470093Z"},"links":{"cited_paper":"/paper/2405.00208","citing_paper":"/paper/2607.10803"},"observation_digest":"sha256:0aacd943c546634c3e6b8c2aec2f0b5bd74e80dd046f64ca782303a89d83b0bb","observation_id":"b8170ba8-a3cf-4660-ae68-63ce9d7b66b4","resolution":{"observed_at":"2026-07-14T09:09:29.470093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.00208/citation-record","integrity":"/paper/2405.00208/integrity","json":"/paper/2405.00208/citation-record.json","paper":"/paper/2405.00208"},"outbound":[],"paper":{"arxiv_id":"2405.00208","last_updated":"2024-10-13T21:05:31Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:00:54.767580Z","submitted_at":"2024-04-30T21:20:17Z","title":"A Primer on the Inner Workings of Transformer-based Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2405.00208."}