{"as_of":"2026-08-22T06:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edcd8689fde3856896cad203babc31b31e5a6402f9cb69b2c27df7caf828d6f2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:10:29.939468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:29:51.021694Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-08-12T10:10:29.939468Z","title":"R., Variengien, A., Conmy, A., Shlegeris, B., and Steinhardt, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19574","last_updated":"2024-12-05T12:19:38Z","snapshot_observed_at":"2026-08-15T13:09:11.103720Z","submitted_at":"2024-11-29T09:42:38Z","title":"KV Shifting Attention Enhances Language Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:29.939468Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2411.19574"},"observation_digest":"sha256:d2f80f068a479575dff66e8ce15e6b24169eb7f74f070cf2a451ade49e85d8fd","observation_id":"95f6278a-07d2-4987-aa4e-a0012191af94","resolution":{"observed_at":"2026-08-12T10:10:29.939468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-08-10T13:42:09.133732Z","title":"How transformers implement induction heads: Approximation and optimization analysis, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16265","last_updated":"2025-05-27T20:00:08Z","snapshot_observed_at":"2026-08-20T10:26:59.587496Z","submitted_at":"2025-01-27T18:03:00Z","title":"Training Dynamics of In-Context Learning in Linear Attention","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T13:42:09.133732Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2501.16265"},"observation_digest":"sha256:d4d70e07e5945c5b27db2751cfbaa5a45c8c5480ac67136c7fdc405f9dbf05f4","observation_id":"26249c99-a298-4db3-be81-cc6fb5aae8bd","resolution":{"observed_at":"2026-08-10T13:42:09.133732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-08-06T16:37:03.512234Z","title":"How transformers implement induction heads: Approximation and optimization analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13540","last_updated":"2025-07-30T01:51:41Z","snapshot_observed_at":"2026-08-17T18:19:09.512181Z","submitted_at":"2025-07-17T21:19:32Z","title":"Provable Low-Frequency Bias of In-Context Learning of Representations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:03.512234Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2507.13540"},"observation_digest":"sha256:1a6830f9ff7aaa44a72199eeedf36aeed4cea3969157677855e3ec2aa532848e","observation_id":"e86347a4-52b2-4b0b-b888-38fbdd3e9914","resolution":{"observed_at":"2026-08-06T16:37:03.512234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":"2410.11474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-07-04T13:29:51.021694Z","title":"How transformers implement induction heads: Approxima- tion and optimization analysis.arXiv preprint arXiv:2410.11474, 2024a","venue":null,"work_id":"3b54b2dc-0a5f-48cf-b752-74ae6f6684e8","year":2025},"citing_paper":{"arxiv_id":"2601.19208","last_updated":"2026-05-12T21:37:09Z","snapshot_observed_at":"2026-08-10T21:14:18.300968Z","submitted_at":"2026-01-27T05:22:34Z","title":"How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T11:20:33.400885Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2601.19208"},"observation_digest":"sha256:5c09c7ff9372028e1eeef17637f57248428bb037dfc69fc16e96d397541e524a","observation_id":"7e600c54-8f07-40bd-bf6f-c1db13a9dbd1","resolution":{"observed_at":"2026-05-16T11:20:52.700106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":"2410.11474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-07-04T13:29:51.021694Z","title":"How transformers implement induction heads: Approxima- tion and optimization analysis.arXiv preprint arXiv:2410.11474, 2024a","venue":null,"work_id":"3b54b2dc-0a5f-48cf-b752-74ae6f6684e8","year":2025},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-08-21T04:14:31.253279Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:6d58c3ea453c1697bb6e5f5b688a9e4fc7c77cced2ce66b0a18e332fd92c0ece","observation_id":"e79b6829-fe16-4969-ac22-6b4b5b7503b2","resolution":{"observed_at":"2026-07-02T07:06:45.020573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":"2410.11474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-07-04T13:29:51.021694Z","title":"How transformers implement induction heads: Approxima- tion and optimization analysis.arXiv preprint arXiv:2410.11474, 2024a","venue":null,"work_id":"3b54b2dc-0a5f-48cf-b752-74ae6f6684e8","year":2025},"citing_paper":{"arxiv_id":"2606.12058","last_updated":"2026-06-10T13:26:56Z","snapshot_observed_at":"2026-08-10T20:49:33.329278Z","submitted_at":"2026-06-10T13:26:56Z","title":"Phase Transitions in Attention: A Bayesian Theory of Copy Head Emergence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T08:13:40.546738Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2606.12058"},"observation_digest":"sha256:f61a09b4ed7beb6380861be8ffe474c421a188979eb05f52bb07ce4592f01bc1","observation_id":"4fbb5b7c-2d6b-4f83-951b-35a53505ab36","resolution":{"observed_at":"2026-07-03T13:18:13.083937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":"2410.11474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-07-04T13:29:51.021694Z","title":"How transformers implement induction heads: Approxima- tion and optimization analysis.arXiv preprint arXiv:2410.11474, 2024a","venue":null,"work_id":"3b54b2dc-0a5f-48cf-b752-74ae6f6684e8","year":2025},"citing_paper":{"arxiv_id":"2606.18164","last_updated":"2026-06-16T17:01:57Z","snapshot_observed_at":"2026-07-30T03:30:31.097644Z","submitted_at":"2026-06-16T17:01:57Z","title":"Learning Dynamics of Chain-of-Thought State Tracking in a Solvable Transformer Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T21:49:03.896740Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2606.18164"},"observation_digest":"sha256:9fa2eacb58e4f0decc345045ec7726894bedd445a0767bbc75ef0fce03c77ab6","observation_id":"a870090c-9c25-4094-bcbe-e10a9c8160ce","resolution":{"observed_at":"2026-07-03T23:39:05.186239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":"2410.11474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-07-04T13:29:51.021694Z","title":"How transformers implement induction heads: Approxima- tion and optimization analysis.arXiv preprint arXiv:2410.11474, 2024a","venue":null,"work_id":"3b54b2dc-0a5f-48cf-b752-74ae6f6684e8","year":2025},"citing_paper":{"arxiv_id":"2606.26749","last_updated":"2026-06-25T08:33:34Z","snapshot_observed_at":"2026-08-01T16:00:20.311664Z","submitted_at":"2026-06-25T08:33:34Z","title":"Structure Before Collapse: Transient semantic geometry in next-token prediction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T05:14:07.208255Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2606.26749"},"observation_digest":"sha256:bd22222055e602ae784feb772912013315f58258e2d6c02f7bc47586f62250a7","observation_id":"794a5b5d-e100-4117-adb7-c6ac245eca7b","resolution":{"observed_at":"2026-07-04T13:29:51.023182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11474","snapshot_observed_at":"2026-08-01T21:30:59.304489Z","title":"arXiv preprint arXiv:2410.11474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16072","last_updated":"2026-07-17T15:56:52Z","snapshot_observed_at":"2026-08-15T10:16:07.079894Z","submitted_at":"2026-07-17T15:56:52Z","title":"Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T21:30:59.304489Z"},"links":{"cited_paper":"/paper/2410.11474","citing_paper":"/paper/2607.16072"},"observation_digest":"sha256:12e520587fe42cca13459f8359a17b15e7c49e6933dfea9d8a1eb7881b6304af","observation_id":"021d6d9d-87b4-4e06-9406-f26597643ef0","resolution":{"observed_at":"2026-08-01T21:30:59.304489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.11474/citation-record","integrity":"/paper/2410.11474/integrity","json":"/paper/2410.11474/citation-record.json","paper":"/paper/2410.11474"},"outbound":[],"paper":{"arxiv_id":"2410.11474","last_updated":"2025-01-29T10:27:40Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:09:14.281725Z","submitted_at":"2024-10-15T10:22:27Z","title":"How Transformers Get Rich: Approximation and Dynamics Analysis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2410.11474."}