{"as_of":"2026-08-12T18:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cedda37e2205001bd3f28058c5f2d98f6b56f428545d8e4151d8a06acc606593","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:06:30.887509Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11459/citation-record","integrity":"/paper/2412.11459/integrity","json":"/paper/2412.11459/citation-record.json","paper":"/paper/2412.11459"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.729472Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning.Advances in Neural Information Pro- cessing Systems, 36:45614–45650, 2023","venue":null,"work_id":"0e48c3c8-d293-496f-8726-f21ded092fa6","year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.595557Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:c71d9d2b2b8bdecddcd7be846cdf837fafddb892de3362c28213ccf98edf8784","observation_id":"ad9ad3f7-c3a7-47f2-af81-6b5cadc92815","resolution":{"observed_at":"2026-08-11T15:06:31.734005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-07T19:33:04.292595Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-11T15:06:30.600927Z","title":"What learning algo- rithm is in-context learning? investigations with linear models.arXiv preprint arXiv:2211.15661, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.600927Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:6b89f9067d7176ede494363c586d2bd340a3b7e8bb79bad1a903cea9fdd2b720","observation_id":"5fcfd14c-5e88-4593-b2dd-f41ce70de5e0","resolution":{"observed_at":"2026-08-11T15:06:30.600927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.716428Z","title":"Learning patterns and pattern se- quences by self-organizing nets of threshold el- ements.IEEE Transactions on computers, 100 (11):1197–1206, 1972","venue":null,"work_id":"a0ab1856-da77-47e2-9fa2-a72d3ae68922","year":1972},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.605286Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:23015fe619b41a84034f26f7ee9213b98ee45601b4af4263acdc01a39e12e54f","observation_id":"4a52f7d3-fa01-4147-86a9-9795fd03ec61","resolution":{"observed_at":"2026-08-11T15:06:31.720616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.609373Z","title":"Rethinking the role of scale for in-context learning: An interpretability-based case study at 66 billion scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.609373Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:13db3ae645d139c5118d8a27590244b4f4cbcf763fee73012f59f092224da131","observation_id":"ab9b470f-1706-4dd2-bb51-e87a3230bc6f","resolution":{"observed_at":"2026-08-11T15:06:30.609373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.697051Z","title":"Birth of a transformer: A memory viewpoint.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"5989b3ca-b3b2-44ca-8d8b-9e5034dc492a","year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.613386Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:17d2d8ee429a174709477994d926412ad780dd4d4d3e26d9724554a1862fe077","observation_id":"770975e3-57f9-421f-b136-dd1ee229d233","resolution":{"observed_at":"2026-08-11T15:06:31.701059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T15:06:30.617684Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.617684Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:595c91cd6be40e4f342711852eca471c3486af2386aba50ebdc39bc36a96ac2b","observation_id":"99d65248-07e8-4d75-8004-032ce4e82687","resolution":{"observed_at":"2026-08-11T15:06:30.617684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02984","last_updated":"2024-02-20T19:17:52Z","snapshot_observed_at":"2026-08-09T04:40:43.234558Z","submitted_at":"2023-10-04T17:20:34Z","title":"Scaling Laws for Associative Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02984","snapshot_observed_at":"2026-08-11T15:06:30.622528Z","title":"Scaling laws for associative memories","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.622528Z"},"links":{"cited_paper":"/paper/2310.02984","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:a44e8b6c91b6e5b8eef84189a9bde9c60d04f74ae5e85eaefd48f423ff24a278","observation_id":"e66e1b42-dc71-4e7a-bfda-f38f5c709797","resolution":{"observed_at":"2026-08-11T15:06:30.622528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18724","last_updated":"2024-02-28T21:47:30Z","snapshot_observed_at":"2026-08-10T13:19:13.885123Z","submitted_at":"2024-02-28T21:47:30Z","title":"Learning Associative Memories with Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18724","snapshot_observed_at":"2026-08-11T15:06:30.627196Z","title":"Learning associative memories with gradient descent.arXiv preprint arXiv:2402.18724, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.627196Z"},"links":{"cited_paper":"/paper/2402.18724","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:aec2b31808168a85ef22c3beccb4b6aa383ee56d73aff33a769742d71bc2be11","observation_id":"cf83075d-3f7d-41a7-b93c-ec3785888d09","resolution":{"observed_at":"2026-08-11T15:06:30.627196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03068","last_updated":"2025-03-06T23:55:51Z","snapshot_observed_at":"2026-08-12T08:16:17.787244Z","submitted_at":"2024-06-05T08:51:08Z","title":"Distributional Associations vs In-Context Reasoning: A Study of Feed-forward and Attention Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03068","snapshot_observed_at":"2026-08-11T15:06:30.631004Z","title":"How truncating weights improves reasoning in lan- guage models.arXiv preprint arXiv:2406.03068, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.631004Z"},"links":{"cited_paper":"/paper/2406.03068","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:2d24fe1c41e2510845198c31fbfb8b98e29b14e07793c99d56c41bcf9bf45320","observation_id":"677af7ad-3f47-4c17-bdde-528c146da339","resolution":{"observed_at":"2026-08-11T15:06:30.631004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10559","last_updated":"2024-09-09T18:10:26Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-09T18:10:26Z","title":"Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10559","snapshot_observed_at":"2026-08-11T15:06:30.635308Z","title":"Unveiling induction heads: Prov- able training dynamics and feature learning in 8 transformers.arXiv preprint arXiv:2409.10559, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.635308Z"},"links":{"cited_paper":"/paper/2409.10559","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:3d54e78dcb5b5e2e40d54a51efdbee98884836c42f00dab8668620a140398d39","observation_id":"22a97b4d-9974-4b12-88db-2eab6e4ca4f0","resolution":{"observed_at":"2026-08-11T15:06:30.635308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.685637Z","title":"Towards automated circuit discovery for mechanistic interpretability.Advances in Neu- ral Information Processing Systems, 36:16318– 16352, 2023","venue":null,"work_id":"51b572b2-ed97-46ea-8cd8-edaf7c1db583","year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.639695Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:6dda307f9cb25770ac384dcea173acbae1264ad26a714199932987fbfa645a8b","observation_id":"dc22d3c5-2b82-425c-b83d-a18559879a84","resolution":{"observed_at":"2026-08-11T15:06:31.689608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.673829Z","title":"Why can GPT learn in-context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":"838db7ee-ed7f-4c06-86e4-d962d932ec6c","year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.643723Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:99697fc648a08bb572c7cb6a2474e51d6ce1cb57f800a5c9b39d281002a6d0b8","observation_id":"5788a190-bb49-418f-ad9b-f8b08acd9f79","resolution":{"observed_at":"2026-08-11T15:06:31.678314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02535","last_updated":"2023-12-24T23:11:19Z","snapshot_observed_at":"2026-08-10T04:19:02.056520Z","submitted_at":"2022-09-06T14:36:57Z","title":"Analyzing Transformers in Embedding Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02535","snapshot_observed_at":"2026-08-11T15:06:30.647483Z","title":"Analyzing transformers in embedding space.arXiv preprint arXiv:2209.02535, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.647483Z"},"links":{"cited_paper":"/paper/2209.02535","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f6e77b552e2b88e1d11d2ab1c118f5f883ab3da1fefa31020e0687f379deae33","observation_id":"88d5cdf7-e290-4377-bb42-62f63a9b5bb2","resolution":{"observed_at":"2026-08-11T15:06:30.647483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T15:06:30.651362Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.651362Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:2c54af7c0df5ed1d62831b7fb251f9f3cdcd4780686bf5d585222d1e7bed120a","observation_id":"ec3aa380-7784-4112-a736-b452ad5c6203","resolution":{"observed_at":"2026-08-11T15:06:30.651362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11004","last_updated":"2024-02-16T18:28:36Z","snapshot_observed_at":"2026-08-12T03:11:15.429400Z","submitted_at":"2024-02-16T18:28:36Z","title":"The Evolution of Statistical Induction Heads: In-Context Learning Markov Chains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11004","snapshot_observed_at":"2026-08-11T15:06:30.659771Z","title":"The evolution of statistical induction heads: In- context learning markov chains.arXiv preprint arXiv:2402.11004, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.659771Z"},"links":{"cited_paper":"/paper/2402.11004","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:a74b5c5ba364a82a7c03ee7fdc3cb5ec99245ad9de56db37f084c7d48d0bd273","observation_id":"74207315-bf49-49f4-9962-8ee23518e8c7","resolution":{"observed_at":"2026-08-11T15:06:30.659771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.664818Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread, 1(1):12, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.664818Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:39cd402bf5e38145143807e37fe3e68e52665df614b25026e226b5d1be920104","observation_id":"3b4bc33e-6a47-431c-91db-fdbc62d89c40","resolution":{"observed_at":"2026-08-11T15:06:30.664818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01128","last_updated":"2023-10-31T00:47:31Z","snapshot_observed_at":"2026-07-06T15:36:52.977284Z","submitted_at":"2023-06-01T20:27:01Z","title":"Learning Transformer Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01128","snapshot_observed_at":"2026-08-11T15:06:30.669296Z","title":"Learning transformer programs, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.669296Z"},"links":{"cited_paper":"/paper/2306.01128","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:73f43d16fddc377dd8f606e54b0116989f265bfb817b823c89a2b893fdba6473","observation_id":"09d976cf-7e7d-472d-b96d-735a4829f5e3","resolution":{"observed_at":"2026-08-11T15:06:30.669296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-12T17:20:07.256299Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-11T15:06:30.674205Z","title":"Transformer feed-forward lay- ers are key-value memories.arXiv preprint arXiv:2012.14913, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.674205Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:8e48beed26de9b1edda46bfdba515a0214cc48015a5a01f4b090966b4f70f8af","observation_id":"d9e40b71-21c9-4313-a9b3-07b867c9e0d7","resolution":{"observed_at":"2026-08-11T15:06:30.674205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14767","last_updated":"2023-10-13T19:01:20Z","snapshot_observed_at":"2026-08-11T02:56:19.720511Z","submitted_at":"2023-04-28T11:26:17Z","title":"Dissecting Recall of Factual Associations in Auto-Regressive Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14767","snapshot_observed_at":"2026-08-11T15:06:30.680594Z","title":"Dissecting recall of factual as- sociations in auto-regressive language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.680594Z"},"links":{"cited_paper":"/paper/2304.14767","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f7f2e2823c3e65ad455b689b81b3eab69a9f28c6417547410c94ccaca7428a49","observation_id":"bb9fb680-f0c6-4e8e-ae0a-7ae934f22b69","resolution":{"observed_at":"2026-08-11T15:06:30.680594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T15:06:30.684936Z","title":"Deberta: Decoding-enhanced bert with disentangled attention.arXiv preprint arXiv:2006.03654, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.684936Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f191f34639617772399be629844425f53112a83e79b2c75d8e5d759717df6c8b","observation_id":"3a3d3316-69ef-487d-834a-05c6638109a9","resolution":{"observed_at":"2026-08-11T15:06:30.684936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.690191Z","title":"Neural networks and physical systems with emergent collective computational abilities.Proceedings of the national academy of sciences, 79(8):2554–2558, 1982","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.690191Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:91edf41688754ecfec4e75408770905210949e3034c4cce8bed9e653af8895ae","observation_id":"3de8f2f8-9f88-4f7b-98a7-b46e32c4cd01","resolution":{"observed_at":"2026-08-11T15:06:30.690191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.693846Z","title":"Neurons with graded response have collective computational properties like those of two-state neurons.Proceedings of the national academy of sciences, 81(10):3088–3092, 1984","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.693846Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:a055fdf66b64a968d9abc919dc51f9b5eabcd24bdf42e2f353dc9168f57ffade","observation_id":"ffe3c293-9935-4769-b01f-e2a791b60762","resolution":{"observed_at":"2026-08-11T15:06:30.693846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05249","last_updated":"2023-10-08T17:55:33Z","snapshot_observed_at":"2026-08-10T14:22:27.023542Z","submitted_at":"2023-10-08T17:55:33Z","title":"In-Context Convergence of Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05249","snapshot_observed_at":"2026-08-11T15:06:30.697406Z","title":"In-context convergence of transformers.arXiv preprint arXiv:2310.05249, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.697406Z"},"links":{"cited_paper":"/paper/2310.05249","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:5cb1eb7cba27633c6e8d893e94543d681fd9c6248a4f087736f05b801db59a46","observation_id":"405f6e6a-499c-4ef6-a2cd-c079b537731b","resolution":{"observed_at":"2026-08-11T15:06:30.697406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13658","last_updated":"2020-09-28T22:18:58Z","snapshot_observed_at":"2026-08-10T13:01:15.278521Z","submitted_at":"2020-09-28T22:18:58Z","title":"Improve Transformer Models with Better Relative Position Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13658","snapshot_observed_at":"2026-08-11T15:06:30.701158Z","title":"Improve transformer models with bet- ter relative position embeddings.arXiv preprint arXiv:2009.13658, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.701158Z"},"links":{"cited_paper":"/paper/2009.13658","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:15506fafee576a7c67c3ff2327faaeb48245823ec6d183158d6d9b9e626fd2ba","observation_id":"df9221f0-c7a6-4463-adde-9735ccaa2c92","resolution":{"observed_at":"2026-08-11T15:06:30.701158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15400","last_updated":"2023-06-27T11:53:25Z","snapshot_observed_at":"2026-07-06T15:47:15.230195Z","submitted_at":"2023-06-27T11:53:25Z","title":"Length Generalization in Arithmetic Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15400","snapshot_observed_at":"2026-08-11T15:06:30.705650Z","title":"Length generalization in arithmetic transformers.arXiv preprint arXiv:2306.15400, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.705650Z"},"links":{"cited_paper":"/paper/2306.15400","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:0b593e7162bd3518539c0a6785f72ee6e089acc6a2a9684af9789b65d2e276b9","observation_id":"a4705b2a-6514-4bfc-8811-c467232b32b2","resolution":{"observed_at":"2026-08-11T15:06:30.705650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18400","last_updated":"2024-11-27T22:41:03Z","snapshot_observed_at":"2026-08-09T12:12:43.549356Z","submitted_at":"2024-06-26T14:49:54Z","title":"Do LLMs dream of elephants (when told not to)? Latent concept association and associative memory in transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18400","snapshot_observed_at":"2026-08-11T15:06:30.709589Z","title":"Do llms dream of ele- phants (when told not to)? latent concept asso- ciation and associative memory in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.709589Z"},"links":{"cited_paper":"/paper/2406.18400","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:6435dfa94109e33cc891580c4d256907fbcc2e54c926da3d00e6f4fef2a55aa7","observation_id":"3d26bea1-078d-482a-b649-cb1d9a2266a6","resolution":{"observed_at":"2026-08-11T15:06:30.709589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.642320Z","title":"The unreasonable effec- tiveness of recurrent neural networks, May","venue":null,"work_id":"60438b11-2a71-4601-8580-04c405680fe0","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.713706Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:73e9b7f1c5485c534c7f7cdb86257d0f4be78e82d40e3921223afc17d0ed9108","observation_id":"cd1d0fcd-1358-4580-81a4-86ad7be4aebd","resolution":{"observed_at":"2026-08-11T15:06:31.646169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.618516Z","title":"The impact of positional encoding on length generalization in transform- ers.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"78d8479b-cf10-4ff7-9a30-de1769109597","year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.721155Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:4bda9b102d20cc75949db6c0db2980f8a732b351f8a59b183ba941f55b54b0b4","observation_id":"b6e6ac95-8f35-477e-b09d-116a53dd0d9f","resolution":{"observed_at":"2026-08-11T15:06:31.621932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15595","last_updated":"2021-03-15T07:56:22Z","snapshot_observed_at":"2026-08-10T13:04:19.097027Z","submitted_at":"2020-06-28T13:11:02Z","title":"Rethinking Positional Encoding in Language Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15595","snapshot_observed_at":"2026-08-11T15:06:30.724755Z","title":"Rethink- ing positional encoding in language pre-training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.724755Z"},"links":{"cited_paper":"/paper/2006.15595","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:49d3f921194d30e09c6acb3a8003e551df80e3ffa45f478261e0ddba86eb6deb","observation_id":"0f47e479-a0b7-4b7b-aea8-2ac7727b117a","resolution":{"observed_at":"2026-08-11T15:06:30.724755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05644","last_updated":"2021-09-13T00:10:02Z","snapshot_observed_at":"2026-07-06T11:46:50.543914Z","submitted_at":"2021-09-13T00:10:02Z","title":"SHAPE: Shifted Absolute Position Embedding for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05644","snapshot_observed_at":"2026-08-11T15:06:30.728751Z","title":"Shape: Shifted absolute posi- tion embedding for transformers.arXiv preprint arXiv:2109.05644, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.728751Z"},"links":{"cited_paper":"/paper/2109.05644","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:80da52a14fbfa38a9cc14341aa3cda6b5508eeafecf4b3afcd84c9b798264ea0","observation_id":"c9fa5e60-f296-4897-9045-37804af49ae7","resolution":{"observed_at":"2026-08-11T15:06:30.728751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01164","last_updated":"2016-09-27T16:05:36Z","snapshot_observed_at":"2026-08-11T02:31:13.574262Z","submitted_at":"2016-06-03T16:17:01Z","title":"Dense Associative Memory for Pattern Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01164","snapshot_observed_at":"2026-08-11T15:06:30.732697Z","title":"Dense as- sociative memory for pattern recognition, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.732697Z"},"links":{"cited_paper":"/paper/1606.01164","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:a9acef2fc7b25c29082bde38b704f2510adf2a6d535733b321055f0aa95bc21b","observation_id":"3fe21f49-3d5a-44de-96dd-9230712d2f4a","resolution":{"observed_at":"2026-08-11T15:06:30.732697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.606104Z","title":"Mechan- ics of next token prediction with self-attention","venue":null,"work_id":"e2b2eca7-256a-434a-ae28-4f52fd84ce15","year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.736966Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:fe48cdfc977f0169b89e8cce58e7f04d88d5df5c2035c68374bd76087d9aa447","observation_id":"2eb14e85-5437-418a-ada0-31bbcf2758ed","resolution":{"observed_at":"2026-08-11T15:06:31.610732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.593650Z","title":"Cape: Encoding relative positions with continuous augmented positional embeddings","venue":null,"work_id":"1ab2247d-b6cd-4983-baa1-ed5026dc1ee2","year":2021},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.740604Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:009694f9e44c3738a030da0d55ecd1c72aafc9ed70cf5d59771bd5a3701910ef","observation_id":"6ca3330d-7d3b-4d85-a77c-2590a12a545b","resolution":{"observed_at":"2026-08-11T15:06:31.598275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.743989Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.743989Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:784bc9a4a2572f277eddced664eedb74128bddde6a7cb74df90f3f3d6d831f04","observation_id":"e1c6db29-71a5-4c9a-bc52-85bece87d44a","resolution":{"observed_at":"2026-08-11T15:06:30.743989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03576","last_updated":"2023-07-07T13:09:18Z","snapshot_observed_at":"2026-08-10T21:08:50.414897Z","submitted_at":"2023-07-07T13:09:18Z","title":"One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03576","snapshot_observed_at":"2026-08-11T15:06:30.747797Z","title":"One step of gradient descent is provably the optimal in-context learner with one layer of linear self-attention.arXiv preprint arXiv:2307.03576, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.747797Z"},"links":{"cited_paper":"/paper/2307.03576","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:af3482d77385a48221fcb46e95fb6120c8681f47649979dd1f50931c5ef5a619","observation_id":"9790ab9f-e076-48f5-b968-a56a684d3f6e","resolution":{"observed_at":"2026-08-11T15:06:30.747797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.581599Z","title":"Locating and editing factual associations in gpt.Advances in Neural Informa- tion Processing Systems, 35:17359–17372, 2022","venue":null,"work_id":"14ac8dda-791c-43c9-9e1b-1abba643fb41","year":2022},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.751702Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:4969b0ab3f524daf83f7c0b85df22443903c3dbabe9331d1860a513579f08896","observation_id":"408ee123-c242-4a52-a9b3-1e2b60866e00","resolution":{"observed_at":"2026-08-11T15:06:31.585732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-11T15:06:30.755450Z","title":"Efficient estimation of word representations in vector space.arXiv preprint arXiv:1301.3781, 3781, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.755450Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:d5e507bd52f68b53ed6a1825e75bab2b0905160852021db79a895b43c811c7a6","observation_id":"7bbce405-afcc-456d-8392-755ec5ee8ae4","resolution":{"observed_at":"2026-08-11T15:06:30.755450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-11T15:06:30.758643Z","title":"Progress mea- sures for grokking via mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.758643Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:44be3e368f582f92c92993d061219695c472d51390d35e15cb505088e5a38478","observation_id":"eebd06bf-62ef-40a1-8909-8e495c885af2","resolution":{"observed_at":"2026-08-11T15:06:30.758643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.569332Z","title":"On the rela- tion between position information and sentence length in neural machine translation","venue":null,"work_id":"cc1ff008-736d-47a2-908e-1ad886b6892a","year":2019},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.761822Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:16e91e528463fe68086e63d909f1a11b36a4814b889a3272963f2fc012f1b950","observation_id":"c0c277ba-e470-4974-894c-25ead4f3af73","resolution":{"observed_at":"2026-08-11T15:06:31.573510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14735","last_updated":"2024-08-13T15:45:37Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:47:03Z","title":"How Transformers Learn Causal Structure with Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14735","snapshot_observed_at":"2026-08-11T15:06:30.765076Z","title":"How transformers learn causal structure with gra- dient descent.arXiv preprint arXiv:2402.14735, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.765076Z"},"links":{"cited_paper":"/paper/2402.14735","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:448de6a6d30742656901d14e180d9c42432ed463fe769c19825b97217e41d1f8","observation_id":"8c183ed2-280b-45ad-925c-ea1580ad48cc","resolution":{"observed_at":"2026-08-11T15:06:30.765076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-11T15:06:30.768808Z","title":"In-context learning and in- duction heads.arXiv preprint arXiv:2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.768808Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:a930cb129102955cf4eabbb61fab7ab4e2e35f4788080b4055e3444b4ed18d87","observation_id":"8a28eed7-1b16-4efe-add8-acee5a370ced","resolution":{"observed_at":"2026-08-11T15:06:30.768808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-11T15:06:30.772493Z","title":"Train short, test long: Attention with linear biases en- ables input length extrapolation.arXiv preprint arXiv:2108.12409, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.772493Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:1a64b7b124550d472402be6025f5a6a743cf603f88a80fa0bfdd6ecb68ef1fd6","observation_id":"4808d3a3-547b-49ea-ae2b-25840acaf06e","resolution":{"observed_at":"2026-08-11T15:06:30.772493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.776578Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.776578Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:9c663cde4779edf4528e7fb34a4b326a8d040a94871ec45be699c6a29fba7dd0","observation_id":"9855d331-a269-4b5f-9e43-7947f80d47a9","resolution":{"observed_at":"2026-08-11T15:06:30.776578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.780438Z","title":"Lan- guage models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.780438Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:acb1a881cfabbef02feadd72e6a0ac10d2f130d2ca8753e2cd31effa309eb187","observation_id":"a881571e-cfd5-4788-a5c4-ce3a1064676b","resolution":{"observed_at":"2026-08-11T15:06:30.780438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.539510Z","title":"Exploring the limits of transfer learning with a unified text- to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":"c9072d0a-8645-44b3-8f2e-47759eb67df1","year":2020},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.784032Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f34ad734c0a1cc27dd5eb3c3d20bd6399158c79f4aee9281da798ad8bb92e1a9","observation_id":"04440c7b-a158-497b-929e-384e98a2d0fd","resolution":{"observed_at":"2026-08-11T15:06:31.544560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.787727Z","title":"Identifying semantic induction heads to under- stand in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.787727Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:7219c1303b2f6ca241e8f7c8590778b77bf97de6e8765ff57f7682bb4cbf615d","observation_id":"0c20aa39-d29b-4089-b353-2fccbbae5a08","resolution":{"observed_at":"2026-08-11T15:06:30.787727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16843","last_updated":"2023-05-26T11:47:52Z","snapshot_observed_at":"2026-08-12T08:33:03.433937Z","submitted_at":"2023-05-26T11:47:52Z","title":"Randomized Positional Encodings Boost Length Generalization of Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16843","snapshot_observed_at":"2026-08-11T15:06:30.791311Z","title":"Ran- domized positional encodings boost length gen- eralization of transformers.arXiv preprint arXiv:2305.16843, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.791311Z"},"links":{"cited_paper":"/paper/2305.16843","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f53a8dd3e7c61835b5ead0cc0e1bb7619a9abe8b9adf1b0abf1a0b4f405ecbe7","observation_id":"31744b4e-9f9e-4071-8aa9-78c0fb6209bb","resolution":{"observed_at":"2026-08-11T15:06:30.791311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02155","last_updated":"2018-04-12T18:51:33Z","snapshot_observed_at":"2026-08-10T12:31:20.109533Z","submitted_at":"2018-03-06T13:13:11Z","title":"Self-Attention with Relative Position Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02155","snapshot_observed_at":"2026-08-11T15:06:30.795596Z","title":"Self-attention with relative position representa- tions.arXiv preprint arXiv:1803.02155, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.795596Z"},"links":{"cited_paper":"/paper/1803.02155","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:dcee8e9c74ed4ca32421952bee8426df334efca27285e807a431921d13b1baf6","observation_id":"7f2acdbf-7db9-4291-b069-568d3d77749a","resolution":{"observed_at":"2026-08-11T15:06:30.795596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12574","last_updated":"2022-10-23T00:00:04Z","snapshot_observed_at":"2026-08-12T15:11:11.543420Z","submitted_at":"2022-10-23T00:00:04Z","title":"The Curious Case of Absolute Position Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12574","snapshot_observed_at":"2026-08-11T15:06:30.799756Z","title":"The curious case of ab- solute position embeddings.arXiv preprint arXiv:2210.12574, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.799756Z"},"links":{"cited_paper":"/paper/2210.12574","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:29161888c38b16cf9afd249e3e512490d6a9fea635215e4c8926ef858ff882f2","observation_id":"18acadc7-4960-4b92-bdf3-a8320901d0a5","resolution":{"observed_at":"2026-08-11T15:06:30.799756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.527088Z","title":"Roformer: En- hanced transformer with rotary position embed- ding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":"12818c48-750d-4116-aad7-f8d6168d4afa","year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.803968Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:94a2b36b885b80b5fab875d84fc5e35efb3bb86e60efc0cf2d0b0cf0a621ac9c","observation_id":"1f3b8b56-3887-41d1-9bea-a43fec2a5e8d","resolution":{"observed_at":"2026-08-11T15:06:31.530811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.807818Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.807818Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f59734274795022f323684a876ee3f89a7c64059fa26a64bd1d822be765e8a88","observation_id":"8aca132c-1795-45d4-b7c4-2aabe5584f63","resolution":{"observed_at":"2026-08-11T15:06:30.807818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.506764Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"c1c1473f-ed03-4317-bc01-98564167877a","year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.811953Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:eaa6c296f69d1946a6a310002c1cfbd420578329c378ef912e98b0c11ce1cf4e","observation_id":"e5010167-3a79-43ba-a5ee-c011e867700a","resolution":{"observed_at":"2026-08-11T15:06:31.511354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.12333","last_updated":"2020-06-28T04:37:07Z","snapshot_observed_at":"2026-08-08T04:39:16.594242Z","submitted_at":"2019-12-27T20:59:38Z","title":"Encoding word order in complex embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.12333","snapshot_observed_at":"2026-08-11T15:06:30.815527Z","title":"Encoding word order in complex embed- dings.arXiv preprint arXiv:1912.12333, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.815527Z"},"links":{"cited_paper":"/paper/1912.12333","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:5be9038ca38d0768efa6dadd83bea3b70aa6b3943585395d433af363d4c078f1","observation_id":"b4d96e97-2245-4016-b195-26912d364830","resolution":{"observed_at":"2026-08-11T15:06:30.815527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-11T15:06:30.819522Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small.arXiv preprint arXiv:2211.00593, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.819522Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:4df67bf185e663a58664bd5274eab67fe4a8c7a4355a65652e1cdbb9e6fdfddc","observation_id":"8f81d085-72d5-4116-997a-f59db5b94876","resolution":{"observed_at":"2026-08-11T15:06:30.819522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.823576Z","title":"La- bel words are anchors: An information flow per- spective for understanding in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.823576Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:2451f31ff9ffb0092872409fff5e515de3237cb2b05073974944330051c90b61","observation_id":"304d6006-80e8-45bc-a4a1-62d42ef619ca","resolution":{"observed_at":"2026-08-11T15:06:30.823576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.492067Z","title":"The learnability of in-context learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"e2f23a58-a30b-4b87-82a0-e6bf0375b202","year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.827592Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:b29de47db664bef2b20cc5fa91a3a73a3dc723355953178c0a4a1e4833ed8c68","observation_id":"02dba459-3199-4f25-bc32-d46104955612","resolution":{"observed_at":"2026-08-11T15:06:31.496953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:30.831223Z","title":"Self-adaptive in-context learn- ing: An information compression perspective for in-context example selection and ordering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.831223Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:62c349a7ad127000b42c0f389c6734f8c0484d03ceb80492ca2de1450bf4bcd9","observation_id":"e8d6887f-34fe-45fa-9531-5f89a01992c9","resolution":{"observed_at":"2026-08-11T15:06:30.831223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-11T15:06:30.834466Z","title":"An explanation of in- context learning as implicit bayesian inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.834466Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:685e2dc4a01e3ff1f1e29c804317312a60f28876ecf69a235f4376c67096d14b","observation_id":"9de2dec0-f3f6-40be-8489-1f6536867ffb","resolution":{"observed_at":"2026-08-11T15:06:30.834466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06394","last_updated":"2025-02-27T21:46:01Z","snapshot_observed_at":"2026-07-06T18:12:34.664133Z","submitted_at":"2024-05-10T11:08:20Z","title":"Memory Mosaics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06394","snapshot_observed_at":"2026-08-11T15:06:30.838044Z","title":"Memory mo- saics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.838044Z"},"links":{"cited_paper":"/paper/2405.06394","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:0ec977992c6401a3463403de675c7a44b926f9a6575099ac35af8dff2326e937","observation_id":"9ff11a43-7c61-4cfd-b0f2-e7778c8cc7b6","resolution":{"observed_at":"2026-08-11T15:06:30.838044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09927","last_updated":"2023-10-19T20:31:32Z","snapshot_observed_at":"2026-08-10T01:42:24.316359Z","submitted_at":"2023-06-16T15:50:03Z","title":"Trained Transformers Learn Linear Models In-Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09927","snapshot_observed_at":"2026-08-11T15:06:30.841729Z","title":"Trained transformers learn linear models in- context.arXiv preprint arXiv:2306.09927, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.841729Z"},"links":{"cited_paper":"/paper/2306.09927","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:0ed26320f3306751f11bc3f8b9603b8ebc88e8f1fb6a6391463242970e2e5808","observation_id":"4f26a7b3-ed9d-47fb-9a2c-994c7c5cd7c5","resolution":{"observed_at":"2026-08-11T15:06:30.841729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19420","last_updated":"2023-10-10T04:47:47Z","snapshot_observed_at":"2026-08-10T11:50:40.040020Z","submitted_at":"2023-05-30T21:23:47Z","title":"What and How does In-Context Learning Learn? Bayesian Model Averaging, Parameterization, and Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19420","snapshot_observed_at":"2026-08-11T15:06:30.845577Z","title":"What and how does in- context learning learn? bayesian model averag- ing, parameterization, and generalization.arXiv preprint arXiv:2305.19420, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.845577Z"},"links":{"cited_paper":"/paper/2305.19420","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:3bb84862510789f93b54c33bb54874c15c050afa9719f77b839e42705285c055","observation_id":"982f6daf-278c-4cbf-8cd8-7aa6197c76a5","resolution":{"observed_at":"2026-08-11T15:06:30.845577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17044","last_updated":"2024-10-06T08:37:05Z","snapshot_observed_at":"2026-08-10T13:01:14.752109Z","submitted_at":"2023-12-28T14:42:24Z","title":"Length Extrapolation of Transformers: A Survey from the Perspective of Positional Encoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17044","snapshot_observed_at":"2026-08-11T15:06:30.849934Z","title":"Length extrapola- tion of transformers: A survey from the per- spective of position encoding.arXiv preprint arXiv:2312.17044, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.849934Z"},"links":{"cited_paper":"/paper/2312.17044","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:26c573cc7e9b2fb624e345794af07acdc5df61152be3b0bcd124ee98d72e63f7","observation_id":"70e3f72b-bc88-4bf9-bbe0-2a55a11bcb12","resolution":{"observed_at":"2026-08-11T15:06:30.849934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.479300Z","title":"In other words, let tq be the first occurrence position","venue":null,"work_id":"30e8bfad-4a18-4dbf-85e0-fd865c190cc5","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.854762Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:0338bdec2c0d3bef48e767133a161a204b1544f1d2b3e44d436c29b85adb2ffe","observation_id":"13cad500-a210-4cb6-9155-40a5e92668f1","resolution":{"observed_at":"2026-08-11T15:06:31.483495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.467689Z","title":null,"venue":null,"work_id":"8758f082-7bb9-4fbb-804c-531d10871d1a","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.859104Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:d9de12735100058fcac504e695b954348237db3970204c3cc4929dab008bec39","observation_id":"62f889b7-2970-4b61-aa7b-dde41e405e2c","resolution":{"observed_at":"2026-08-11T15:06:31.471809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.456133Z","title":null,"venue":null,"work_id":"d8cb4e89-6968-41bd-a763-3347b4d0ab38","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.863249Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:5c96e92b5756b1a3b2f6504e21d7a311183863bfab96c0b246f44b7250b72a76","observation_id":"24c3e12b-38d5-4cc4-94a7-8eac6bf452ed","resolution":{"observed_at":"2026-08-11T15:06:31.460118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.443075Z","title":"We employ zero- initialization and carry out a single gradient de- scent step","venue":null,"work_id":"049730bc-546c-4b08-af60-a64ee1035f12","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.867260Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:7cbd5d74eb03f99b164a9de7046abd59df4b04fc783d3fe29e4885b98e61fe44","observation_id":"35477c55-6548-4248-8d4e-e5908bd88f33","resolution":{"observed_at":"2026-08-11T15:06:31.447744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.429178Z","title":"TX t=to W 2 V 1 t Φ1wE(zto)|y=k # − 1 T ·E","venue":null,"work_id":"6d93c4b5-cbd0-4fe8-b2aa-315615a5d293","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.871144Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f6e0b5f8c5ce88be29f5fb31414c1aadd61ae3edd9c8efb59989c35dd402df85","observation_id":"ebab3649-9b11-40f5-af2f-d9d2e0555eca","resolution":{"observed_at":"2026-08-11T15:06:31.433540Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.416930Z","title":null,"venue":null,"work_id":"1cd1917c-9fb8-41bc-9bb1-fcf6d63901d4","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.876561Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:4a0f1e11290a3b04b6d33515b2ff3384a31e954328c448e6c81f286946793057","observation_id":"cff2710d-1b3c-4f6f-94ff-2d1ee0eec58d","resolution":{"observed_at":"2026-08-11T15:06:31.420465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.405690Z","title":null,"venue":null,"work_id":"25f84b4f-8388-4d3f-a1b4-1fe4b13e6ae1","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.880209Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:30cfd7a5af76678082c4d603369b9aa6495ac6cf8092ea79073579d41f14f98f","observation_id":"74b5f145-c93c-451b-a569-bf7c8a2d5ede","resolution":{"observed_at":"2026-08-11T15:06:31.409305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.393486Z","title":null,"venue":null,"work_id":"054328c3-ab99-413d-8b55-32e017aee5a6","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.883734Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f92222b8a9772554ebce2db98f5719a855d21a8085d2c65dab98f298c165fb4b","observation_id":"d05a34f2-8366-4b55-985b-a50096882542","resolution":{"observed_at":"2026-08-11T15:06:31.397317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.378462Z","title":"Everytime we generate an input sequence, we sam- ple5trigger tokens from the set of all source words, and uniformly selects the corresponding output tokens from all vocabulary","venue":null,"work_id":"1fe8b9a6-fc0f-4ed6-a9d4-d6af4d50f025","year":null},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.887509Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:9cacc4d1cb49d8ae72b6b218233ccd93491ce6abce22264b8b6e425026aacdcd","observation_id":"44ec3885-ad92-48bb-ae04-dbfea01fa909","resolution":{"observed_at":"2026-08-11T15:06:31.384668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:06:31.630396Z","title":"Accessed: 2024-12-15","venue":null,"work_id":"3eabcd70-00bc-49ab-97f9-02e2b6c35daa","year":2015},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.717503Z"},"links":{"citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:66511e6ce0d46058f4c6c75826f5032f815c3a6a5de317b14d3dc2b729049afd","observation_id":"6ca3bc0c-e140-4937-9ae8-2bb75487a513","resolution":{"observed_at":"2026-08-11T15:06:31.634491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2412.11459."}