{"as_of":"2026-08-11T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbb66cfcdedd0a5aaa913cad931a7e6e292d1fbf9cdfdb4bd509d917cffb114b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:55:02.266549Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.070496Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-10T14:55:02.266549Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14926","last_updated":"2025-02-07T19:22:32Z","snapshot_observed_at":"2026-08-10T14:44:40.420977Z","submitted_at":"2025-01-24T21:31:12Z","title":"Interpretability in Parameter Space: Minimizing Mechanistic Description Length with Attribution-based Parameter Decomposition","version":4},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T14:55:02.266549Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2501.14926"},"observation_digest":"sha256:cb3d6338a1fc2ec4d9fb5e8855227b0d8555f1b0dad1b2cef87f6215e3e0f13c","observation_id":"bc79648e-9b45-462e-8880-808f654d0a90","resolution":{"observed_at":"2026-08-10T14:55:02.266549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-09T23:32:04.148129Z","title":"org/abs/2410.02984","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18666","last_updated":"2025-01-30T15:56:25Z","snapshot_observed_at":"2026-08-10T22:25:34.743761Z","submitted_at":"2025-01-30T15:56:25Z","title":"Structure Development in List-Sorting Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T23:32:04.148129Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2501.18666"},"observation_digest":"sha256:d8351082f02ab05236f82e0f4d202018716e4a048bac82258e27025c09dfde2c","observation_id":"07a030f6-b1ee-4477-9bfb-743cd09bc131","resolution":{"observed_at":"2026-08-09T23:32:04.148129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-09T22:32:02.283805Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18812","last_updated":"2025-04-08T00:36:01Z","snapshot_observed_at":"2026-08-10T01:24:55.362338Z","submitted_at":"2025-01-31T00:16:06Z","title":"Estimating the Probability of Sampling a Trained Neural Network at Random","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T22:32:02.283805Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2501.18812"},"observation_digest":"sha256:04d92d78232772eb4a4c8b8da9a013727ef28b3bea4e6d7388479be2a01aa884","observation_id":"ebf7ce01-8f6e-4fcc-906e-394e9be6a8e3","resolution":{"observed_at":"2026-08-09T22:32:02.283805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-06T22:48:39.266827Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20790","last_updated":"2025-09-04T11:41:34Z","snapshot_observed_at":"2026-08-09T03:26:19.673933Z","submitted_at":"2025-06-25T19:26:31Z","title":"Stochastic Parameter Decomposition","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:48:39.266827Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2506.20790"},"observation_digest":"sha256:b357ffbb5a89a9bef38ea419d80f21d5196909f255d44f71e84a48c0d07d2d44","observation_id":"33004008-74e1-4aac-af6d-2d62d86b86e2","resolution":{"observed_at":"2026-08-06T22:48:39.266827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-06T12:50:59.050476Z","title":"Sumio Watanabe","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.21449","last_updated":"2026-08-03T15:06:32Z","snapshot_observed_at":"2026-08-06T23:27:49.882145Z","submitted_at":"2025-07-29T02:38:57Z","title":"From Global to Local: A Scalable Benchmark for Local Posterior Sampling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:59.050476Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2507.21449"},"observation_digest":"sha256:6b0e0228190cd58232c2de77e7c1d136e0f28888092fa14947c0e99f3981a41e","observation_id":"d7f5f323-49dc-4ee7-92e7-77e61ff84f6d","resolution":{"observed_at":"2026-08-06T12:50:59.050476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-06T10:16:49.978359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00331","last_updated":"2025-08-01T05:39:41Z","snapshot_observed_at":"2026-08-09T02:15:13.618264Z","submitted_at":"2025-08-01T05:39:41Z","title":"Embryology of a Language Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T10:16:49.978359Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2508.00331"},"observation_digest":"sha256:6dd7c9f2829eb37240e2f6a2ba57d1904a3deeb664f8981e15a086d8454ed0ba","observation_id":"8aa27789-5963-4c15-96fa-27fd2cdc90ca","resolution":{"observed_at":"2026-08-06T10:16:49.978359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2509.24328","last_updated":"2026-04-20T02:54:34Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T06:25:54Z","title":"Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T13:17:57.627009Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2509.24328"},"observation_digest":"sha256:d6c014e146a24fbe99ceb9c3a2aa716a084e63a94bced5310d8ae20e6bfbe692","observation_id":"81aed736-beff-4e20-b28b-0aea58b30eba","resolution":{"observed_at":"2026-05-18T13:21:24.236551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-02T19:04:54.409550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.03993","last_updated":"2026-06-04T09:24:00Z","snapshot_observed_at":"2026-08-04T23:26:46.694753Z","submitted_at":"2026-03-04T12:37:08Z","title":"Specialization of softmax attention heads: insights from the high-dimensional single-location model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T19:04:54.409550Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2603.03993"},"observation_digest":"sha256:445be6d78028370685ebb7755760811f2bf2d1f5229ed860c0a8d68e4994528d","observation_id":"3b4f0e60-d96c-465c-8fc7-13da0cf08f9e","resolution":{"observed_at":"2026-08-02T19:04:54.409550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2604.18970","last_updated":"2026-05-25T07:51:27Z","snapshot_observed_at":"2026-08-01T13:21:43.547756Z","submitted_at":"2026-04-21T01:39:57Z","title":"Mechanistic Anomaly Detection via Functional Attribution","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-10T03:00:17.876145Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2604.18970"},"observation_digest":"sha256:ebb0b73a820b610c1c9cb43ad9fcf926c5013a73bcd35f96c4204d7e48868b21","observation_id":"7d472f3f-4403-43d0-a6a4-db97f15b5885","resolution":{"observed_at":"2026-05-11T12:46:10.121385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2605.07980","last_updated":"2026-05-08T16:43:48Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T16:43:48Z","title":"Susceptibilities and Patterning: A Primer on Linear Response in Bayesian Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:09:43.387814Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2605.07980"},"observation_digest":"sha256:41cc492f922159b5ef80a544c538d946f9c2e790c5a25b3ab75e686cc084dc5a","observation_id":"ea58d5ce-250c-4df5-8f60-c970f3adc259","resolution":{"observed_at":"2026-05-11T03:55:54.503334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2605.15183","last_updated":"2026-05-14T17:58:27Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T17:58:27Z","title":"When Are Two Networks the Same? Tensor Similarity for Mechanistic Interpretability","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T03:17:22.217041Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2605.15183"},"observation_digest":"sha256:b1e1c9bb59a3db4d38af94df280505b5497fd157d5695376d57077725d4d124a","observation_id":"41a5833a-f301-413c-8ac8-baecf2fb57a5","resolution":{"observed_at":"2026-05-15T03:19:43.657725Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2605.20441","last_updated":"2026-05-19T19:48:40Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T19:48:40Z","title":"Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T07:30:07.287938Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2605.20441"},"observation_digest":"sha256:f4aac58d29b7c548284585b90016e5c5bdac22377ff90e4d1b4f7d55a1ab209c","observation_id":"e9068c25-6c64-436d-8038-70d0f542fdd0","resolution":{"observed_at":"2026-05-21T07:34:02.937838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2606.05957","last_updated":"2026-06-04T09:54:08Z","snapshot_observed_at":"2026-08-08T05:42:33.934596Z","submitted_at":"2026-06-04T09:54:08Z","title":"Dead Directions: Geometric Singular Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T03:20:09.365073Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2606.05957"},"observation_digest":"sha256:38c4dbfa80febd67fcdaf18e2b3c77c8ecf68e80ca357000189b2347b6a2fbee","observation_id":"b49a05dc-f021-4ecd-aec7-f24ff786fae2","resolution":{"observed_at":"2026-07-02T11:36:55.227766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2606.19491","last_updated":"2026-06-17T18:28:37Z","snapshot_observed_at":"2026-07-31T17:54:27.925523Z","submitted_at":"2026-06-17T18:28:37Z","title":"Algebraic Dead Directions in LayerNorm Transformers: A Forward-Pass-Only Diagnostic at LLM Scale","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:11.815522Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2606.19491"},"observation_digest":"sha256:340ebc8ac6d8aad20ac3e0bfbab5a4deab04a3c2e9b8c1cf1b2202ec0b34647b","observation_id":"def571b0-e0aa-4c99-a909-54116d57e554","resolution":{"observed_at":"2026-07-04T00:29:15.257929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2606.21158","last_updated":"2026-06-19T06:49:09Z","snapshot_observed_at":"2026-08-07T17:21:07.399715Z","submitted_at":"2026-06-19T06:49:09Z","title":"Dead-Direction Signatures: A Cheap Spectral Reading of Singular Complexity","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T14:36:17.793710Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2606.21158"},"observation_digest":"sha256:dc1d4097872c608aced5a4d1b8e2ac624a4260744059f89dab37401ff3117409","observation_id":"566917a8-6911-44d8-9be7-a5b907499fd2","resolution":{"observed_at":"2026-07-04T06:19:38.228473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2606.26050","last_updated":"2026-06-24T17:27:13Z","snapshot_observed_at":"2026-08-07T00:02:16.959388Z","submitted_at":"2026-06-24T17:27:13Z","title":"Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-25T19:04:11.976747Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2606.26050"},"observation_digest":"sha256:a14232df697228768f79ede4929b25b34318f4b9eb7513f8ae42dee421e02524","observation_id":"0ffdcc8c-94e7-496c-8a3c-1d23243df397","resolution":{"observed_at":"2026-07-04T21:10:09.072092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":"2410.02984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-07-04T21:10:09.070496Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient.arXiv preprint arXiv:2410.02984","venue":null,"work_id":"38eb8f8a-c56b-40b0-aaa9-fd1e7222cf67","year":2024},"citing_paper":{"arxiv_id":"2607.00603","last_updated":"2026-07-01T08:29:36Z","snapshot_observed_at":"2026-08-08T09:05:33.144797Z","submitted_at":"2026-07-01T08:29:36Z","title":"Measuring Dead Directions: Decomposing and Classifying Singular Structure off Canonical Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-02T15:56:11.362639Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2607.00603"},"observation_digest":"sha256:29043b4fc2969d58c1c505d6b086520868e5f05cd9f6ae8c7c804c9faf8f44bd","observation_id":"9a7c1848-6b5d-47e4-9d88-c7251d0b2870","resolution":{"observed_at":"2026-07-02T15:57:06.355684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-01T07:46:23.736421Z","title":"arXiv preprint arXiv:2410.02984 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21356","last_updated":"2026-07-23T14:19:28Z","snapshot_observed_at":"2026-08-07T19:47:51.895704Z","submitted_at":"2026-07-23T14:19:28Z","title":"Emergent Misalignment Recruits a Pre-existing Persona Subspace","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-08-01T07:46:23.736421Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2607.21356"},"observation_digest":"sha256:1ab2f6710576557113d739131d5b704b16948bbc7a94bea50adb70cf37eb1153","observation_id":"4a56f6e0-6378-4f6a-bccd-d4bd8e06aab9","resolution":{"observed_at":"2026-08-01T07:46:23.736421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02984/citation-record","integrity":"/paper/2410.02984/integrity","json":"/paper/2410.02984/citation-record.json","paper":"/paper/2410.02984"},"outbound":[],"paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T10:42:48.370492Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2410.02984."}