{"as_of":"2026-08-17T18:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4af8dd6884defd2cf545502bcc275ce7452e6798f60a1f2e599057b8c9280230","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:39:18.403313Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:15:48.968402Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T04:15:49.290160Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"cited_work":{"arxiv_id":"2608.06776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.06776","snapshot_observed_at":"2026-08-14T04:15:49.290160Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","venue":"cs.LG","work_id":"275ade49-eab2-4946-999b-95ba081e0d19","year":2026},"citing_paper":{"arxiv_id":"2608.10288","last_updated":"2026-08-10T22:45:22Z","snapshot_observed_at":"2026-08-16T18:06:38.184117Z","submitted_at":"2026-08-10T22:45:22Z","title":"Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:15:48.968402Z"},"links":{"cited_paper":"/paper/2608.06776","citing_paper":"/paper/2608.10288"},"observation_digest":"sha256:1f1424e8c3b6588c3809467fea28fc234a396fdfa0accfb96046467895cd187e","observation_id":"f6db4ff7-a0e7-480d-a701-6470ca84d468","resolution":{"observed_at":"2026-08-14T04:15:49.294748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.06776/citation-record","integrity":"/paper/2608.06776/integrity","json":"/paper/2608.06776/citation-record.json","paper":"/paper/2608.06776"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1802.06509","last_updated":"2018-06-11T06:17:24Z","snapshot_observed_at":"2026-08-17T13:07:51.754965Z","submitted_at":"2018-02-19T03:08:26Z","title":"On the Optimization of Deep Networks: Implicit Acceleration by Overparameterization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06509","snapshot_observed_at":"2026-08-15T14:39:18.024092Z","title":"On the optimization of deep networks: Implicit acceleration by overparameterization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.024092Z"},"links":{"cited_paper":"/paper/1802.06509","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:2008b0b1298755519b4b22a81ae2252a5ad245517084dc1f6c0d4cd6b7bc4a9d","observation_id":"05db1fb3-1915-4d4d-8c9c-42167c5cf6af","resolution":{"observed_at":"2026-08-15T14:39:18.024092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.529705Z","title":"Self-attention networks localize when qk-eigenspectrum concentrates","venue":null,"work_id":"06a239b8-14b6-4dcf-bf63-388aee99583c","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.031138Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:893fc6077d39374a7d3e89b8a4f6d98cb2349e79452ffe3bb84a244ed25e1a23","observation_id":"1f04f26b-4471-4ce9-bd8c-9554a47a806a","resolution":{"observed_at":"2026-08-15T14:39:19.535605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.506239Z","title":"Birth of a transformer: a memory viewpoint","venue":null,"work_id":"ba3e0c6f-09fa-40cd-8cfa-b566b69bbf86","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.047780Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:5d018b8028944da1fb2bd81a440325cab2f98607189740a6b625c613de6b0109","observation_id":"cd6eb2e9-caea-43e5-ad11-61852b497662","resolution":{"observed_at":"2026-08-15T14:39:19.513920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T14:39:18.052596Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.052596Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:5b833dd23d624311b19177b015ee666ca07c91db8fef56209517b525e81943ae","observation_id":"68441002-f3d1-488f-844c-f3690651deba","resolution":{"observed_at":"2026-08-15T14:39:18.052596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-08-13T07:34:17.550838Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-15T14:39:18.057149Z","title":"Universal transformers","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.057149Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:1e6a6884d6dc345e98d4d8f40cbd540e3d6859729dfd64133d3d04839bf80d93","observation_id":"c4b2cc58-65ff-4a71-be7b-5feffc94c991","resolution":{"observed_at":"2026-08-15T14:39:18.057149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.489551Z","title":"On the optimization and generalization of multi-head attention","venue":null,"work_id":"09653f14-e266-484a-b281-52cac5a5ff98","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.062406Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:25116302e0e9aecb51a58ac58b61e209816d8a8d60662a7b295496c04b89f0c5","observation_id":"067bf91f-cb3a-40d2-ab3e-795be6d9a3c1","resolution":{"observed_at":"2026-08-15T14:39:19.494546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12680","last_updated":"2024-10-12T04:12:31Z","snapshot_observed_at":"2026-08-17T03:01:59.504460Z","submitted_at":"2023-10-19T12:18:24Z","title":"On the Optimization and Generalization of Multi-head Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12680","snapshot_observed_at":"2026-08-15T14:39:18.066978Z","title":"On the optimization and generalization of multi-head attention, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.066978Z"},"links":{"cited_paper":"/paper/2310.12680","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:780aead4321d8647594818e3e71cc9eddef878fa12a6f59c0fb7a1fccc91408e","observation_id":"e9cbbafc-1209-481a-8049-06b45c4e698f","resolution":{"observed_at":"2026-08-15T14:39:18.066978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T14:39:18.077317Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.077317Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:5b697ffd38d9d9b192af2084c6234e4265f033372f540f5cc31969a1199d1a0c","observation_id":"6d32f044-0fca-489c-87a3-948b4f932167","resolution":{"observed_at":"2026-08-15T14:39:18.077317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.473293Z","title":"S., Hu, W., and Lee, J","venue":null,"work_id":"a50b17ec-e3dc-4a35-9b8b-3357cd51bbe3","year":2018},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.082324Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:7119b03a142a90663b92709827f6d14aeb6ea653aadb630ec6a1c676e6e612b4","observation_id":"e466f636-4ef9-494b-b147-0b4bf080a84d","resolution":{"observed_at":"2026-08-15T14:39:19.478602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.086746Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.086746Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:c1008992b85b6d13d5f848b0ecaf9d7c0f0de1f98c548ff95d7d20dfdd3471be","observation_id":"cb061834-8ad3-4064-af60-2b39a56c5cab","resolution":{"observed_at":"2026-08-15T14:39:18.086746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.444775Z","title":"The emergence of clusters in self-attention dynamics","venue":null,"work_id":"6ed2d4c1-587b-46f4-b5f0-2d27fa14a3e5","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.091642Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:803f9a696063f52d0584b062623ef2406f2e5ed7dc888c0d81a8a5a666523dc5","observation_id":"943218e2-4634-4659-bb85-c76682efc00d","resolution":{"observed_at":"2026-08-15T14:39:19.450939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.423259Z","title":"and Wallace, B","venue":null,"work_id":"cb7eacbd-50be-4d78-90ed-253a7d8c28c4","year":2019},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.096096Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:435c57df8758d7c091c967ee7bb53bb5bd4e0855962ea732b15426ad24d27c94","observation_id":"2d979015-6b34-4794-b445-e49d6f16c970","resolution":{"observed_at":"2026-08-15T14:39:19.428665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.406183Z","title":"Clustering in causal attention masking","venue":null,"work_id":"e9edd5eb-7257-4d1a-a82c-696df7acbd3a","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.100541Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:a7c82af492a57c27cfcbd1b9fa95a1d8691dca3d848886ff9a25dcc94168d33d","observation_id":"aeb751e1-e6a1-464f-8c3e-9554802a074b","resolution":{"observed_at":"2026-08-15T14:39:19.411456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11607","last_updated":"2025-06-04T06:06:21Z","snapshot_observed_at":"2026-08-16T15:46:39.647278Z","submitted_at":"2023-03-21T06:00:39Z","title":"Transformers in Speech Processing: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11607","snapshot_observed_at":"2026-08-15T14:39:18.105188Z","title":"Transformers in speech processing: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.105188Z"},"links":{"cited_paper":"/paper/2303.11607","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:fbe8b1ca9309aa37c7ed957795557ce9c513ad681a80b15bcc1c335758e662e4","observation_id":"fbb1ea4c-32ed-400f-b5bf-9c2a5f4e0b06","resolution":{"observed_at":"2026-08-15T14:39:18.105188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.389059Z","title":"How do transformers learn topic structure: towards a mechanistic understanding","venue":null,"work_id":"6d7b25fb-1025-4e5a-a708-ea1542abb76e","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.110194Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:7fd2b88aaf8074ecf7c53785811fb0b285341d422cd70e87aed8104be07135bf","observation_id":"ed667f7c-1045-4aa7-aeb8-e55d0dee41c1","resolution":{"observed_at":"2026-08-15T14:39:19.394395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08081","last_updated":"2024-03-12T21:15:38Z","snapshot_observed_at":"2026-08-16T14:10:25.011013Z","submitted_at":"2024-03-12T21:15:38Z","title":"Mechanics of Next Token Prediction with Self-Attention","version":1},"cited_work":{"arxiv_id":"2403.08081","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.08081","snapshot_observed_at":"2026-08-15T14:39:18.609363Z","title":"Mechanics of Next Token Prediction with Self-Attention","venue":"cs.LG","work_id":"8ac05f03-a2e9-428f-8d6b-24eaa7a77dab","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.114791Z"},"links":{"cited_paper":"/paper/2403.08081","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:bdb5c35638d72109291530dd58a7075b546aa34a0dd4713ec3a1a90e9e1751e4","observation_id":"98b45860-5b3b-499c-bdfd-1ab759a7fca4","resolution":{"observed_at":"2026-08-15T14:39:18.616383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.370747Z","title":"On the dynamics of training attention models","venue":null,"work_id":"b5ca53ac-0836-4239-ac27-cfef10e76c79","year":2021},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.124678Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:ae512564ea880c8bc1ca2db228f8120a0465804cae7869d1e64d1c836c582c74","observation_id":"3b8c52ce-c7a1-41a4-aff1-6afe9c5d5b1b","resolution":{"observed_at":"2026-08-15T14:39:19.375759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.355428Z","title":"M., Biemann, C., Goyal, P., and Mukherjee, A","venue":null,"work_id":"7df450f6-975a-42d8-afb2-c1bfecbf2949","year":2020},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.129625Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:8c5db7194ce8b86a4310b82aa6c7697e0effd808ae228a43a584e6e14a81b8b0","observation_id":"075fc0dd-a114-433e-9230-450eb2083918","resolution":{"observed_at":"2026-08-15T14:39:19.359952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.134544Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.134544Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:0b7f2f1c821ba3dbc8f7a514c8afb8434fab4a32cafa60dc1e147aeed497f4a2","observation_id":"51cf7cdf-3d68-464b-8078-1685cf2ed3df","resolution":{"observed_at":"2026-08-15T14:39:18.134544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.329744Z","title":"N., Vashisht, R., and Ramaswamy, H","venue":null,"work_id":"7d25208b-907d-4947-a589-07653784a950","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.139452Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:1250467ef74f460f593d424a510582f8735fb142ea172f1e40bf74dee8f1d832","observation_id":"52b99241-6a03-4d27-87eb-66ac25ca15bc","resolution":{"observed_at":"2026-08-15T14:39:19.334617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.312497Z","title":"Attention is turing complete","venue":null,"work_id":"6ef458e5-0384-4e4e-ae6b-e2c8aae19528","year":2021},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.144322Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:8983fb57d8ba9ebd0e365f8e4376e1fda568293dea097bb1b8838169119cb720","observation_id":"5fe12347-73ea-4936-9372-1998bc77a2d9","resolution":{"observed_at":"2026-08-15T14:39:19.317498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.150061Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.150061Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:5930d40dc9d24ebd5450f4f0b90d80348d33cca3e4e29b4476b93ba96f311121","observation_id":"1b8e5479-3e76-4b9b-8c91-81e0fd0b96e3","resolution":{"observed_at":"2026-08-15T14:39:18.150061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.282932Z","title":"Scan and snap: understanding training dynamics and token composition in 1-layer transformer","venue":null,"work_id":"43e9f551-2e73-4247-9b81-2c66b633b292","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.165853Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:a571948d8602276bb617336f5adbb2933590617953bdb8c285618328e6c3c7e3","observation_id":"8be5a6b6-9d0b-4cd2-9274-9fba9d662ea9","resolution":{"observed_at":"2026-08-15T14:39:19.287972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.267018Z","title":"and Ramaswamy, H","venue":null,"work_id":"0023b05c-604e-440b-add3-c045a7d8a502","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.171140Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:b71da6cb32b664251acce46bf1a9f3f2e660c01954be105c3d7ffa073a4df343","observation_id":"1ffb953c-5610-48a1-adee-fdafc300c806","resolution":{"observed_at":"2026-08-15T14:39:19.272360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.176192Z","title":"N., Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.176192Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:89b66618b28b5968887f71df8c152e11d20a3f2278af63f46ca577873abcf8b6","observation_id":"7f632b6b-0afa-41fb-9f36-6a46896f5417","resolution":{"observed_at":"2026-08-15T14:39:18.176192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10077","last_updated":"2020-02-25T03:12:57Z","snapshot_observed_at":"2026-08-14T11:38:04.558916Z","submitted_at":"2019-12-20T19:49:32Z","title":"Are Transformers universal approximators of sequence-to-sequence functions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.10077","snapshot_observed_at":"2026-08-15T14:39:18.186873Z","title":"S., Reddi, S","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.186873Z"},"links":{"cited_paper":"/paper/1912.10077","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:a5dba73c1b2fa5466d76766b37185f81ac75c9f26fb1b1a35374f4701e74e95a","observation_id":"b029877b-2e9f-4876-aa2c-e7bad65ca26b","resolution":{"observed_at":"2026-08-15T14:39:18.186873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.241395Z","title":"Attention is All you Need , url =","venue":null,"work_id":"6a675d3f-7503-42c4-996d-ecb635d5d7c8","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.191872Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:6d43f416c7c47a03c8271d73c7c827b19aa82f76c012dfcad8fc9eb00f4efd70","observation_id":"85017a99-ae25-4307-a77e-cbcdae1831a7","resolution":{"observed_at":"2026-08-15T14:39:19.247018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.224474Z","title":"ArXiv , year=","venue":null,"work_id":"1cce2c16-4bf0-4c05-ad29-ec9bf749da1c","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.197816Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:4b754152763985d4316a43498ae11bd8c7e810259fffc7a510640492b0183ba3","observation_id":"a9962a82-cb5f-4b3b-bfb0-52dc99b649be","resolution":{"observed_at":"2026-08-15T14:39:19.229176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.208602Z","title":"and Kumar, Sanjiv , biburl =","venue":null,"work_id":"b9529494-cb2a-4574-9a62-2a3611979cd6","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.203365Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:83ab8daf7c435a995dc4e4e551613b9c7deab9109844d424bb736dc17c9c0d0f","observation_id":"2ce633c1-dec7-4c60-afb2-4cd12f19af38","resolution":{"observed_at":"2026-08-15T14:39:19.213639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.208510Z","title":"On the Computational Power of Transformers and Its Implications in Sequence Modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.208510Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:8ede1ec7484c1e83af7bc5fb6f707ec47b08dc8d1bb196c277de05c4417bdd51","observation_id":"5d45f57c-fe0f-49be-8482-35a94a84243d","resolution":{"observed_at":"2026-08-15T14:39:18.208510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.213259Z","title":"On the A bility and L imitations of T ransformers to R ecognize F ormal L anguages","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.213259Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:35b387bd71d388623c8237d31c67026e92092ad327e3c6fac565eb915fe74e78","observation_id":"d4cb7314-b594-4f33-8148-cd3c81dac9e1","resolution":{"observed_at":"2026-08-15T14:39:18.213259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.191640Z","title":"ArXiv , year=","venue":null,"work_id":"5dfb1623-6e6d-416d-ab6b-fc6eac855e96","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.219271Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:295944e0a11895852320c72d1997212ece7cbc11784515c2c3e9a5b9130e43f4","observation_id":"3b8377c4-f28d-453a-acb9-f3fd5d7cd7fd","resolution":{"observed_at":"2026-08-15T14:39:19.197617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.173500Z","title":"Attention is turing complete , year =","venue":null,"work_id":"4b9d7ec8-8bfb-45a8-9fc8-cea73b17d756","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.224200Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:2eb69b27b20ed0cd8fcb56de4b5ea4ecbc294e7adf5d6d8c5deb7e7c47ae0d41","observation_id":"d77dc4ac-07c0-43b2-ab88-db6a58df865a","resolution":{"observed_at":"2026-08-15T14:39:19.179134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.157276Z","title":"and Ba, Jimmy , biburl =","venue":null,"work_id":"18fe00cb-e600-478a-abbc-7a03f4e38715","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.231213Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:89d2d20fcaff81534ecc9c590bda94ea494b4c3eb50c4748026d68335beb2c61","observation_id":"61fbacbd-5c02-4471-afc2-08d979fb5a98","resolution":{"observed_at":"2026-08-15T14:39:19.161972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.237378Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.237378Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:f03ceb881929573edca7b94026c9b6bc528a423cfd7fa898e6c363f7f350913a","observation_id":"c4106af3-60f1-4649-bdb5-0c2563327275","resolution":{"observed_at":"2026-08-15T14:39:18.237378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.242650Z","title":"2021 , journal=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.242650Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:c55329615a616fd255cdb5ac7706c21855cb4b0795ae50c622fccb6e4a165d4e","observation_id":"b29081aa-6747-4c23-881c-16e2651e7f3f","resolution":{"observed_at":"2026-08-15T14:39:18.242650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.115915Z","title":"In-context Learning and Induction Heads","venue":null,"work_id":"99dd41c5-1ace-450b-927b-5f2e55095154","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.247761Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:cc160342995d4d30a22180d483f80bbcc909f81bae63f03dec48200e2378f2cc","observation_id":"a08a058c-d101-4628-a59b-99d93c1190fb","resolution":{"observed_at":"2026-08-15T14:39:19.122060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.098484Z","title":"Birth of a transformer: a memory viewpoint , year =","venue":null,"work_id":"64722502-012b-46d0-ac58-ef6c06b44ed3","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.253256Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:d650936c5313de170bd1d0711aac924533c603c8c811717c85492f47a46a8fab","observation_id":"2eb62838-e40d-4716-ab1a-13ba5b48a26f","resolution":{"observed_at":"2026-08-15T14:39:19.103887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.258382Z","title":"SQ u AD : 100,000+ Questions for Machine Comprehension of Text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.258382Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:adb357807d778faeaebb52e5ec2bd7f097ab4e121f7d73cfff519b64b48111c0","observation_id":"9be6d413-dccf-4002-8194-ad25097c2cab","resolution":{"observed_at":"2026-08-15T14:39:18.258382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.262761Z","title":"Assessing the Ability of LSTM s to Learn Syntax-Sensitive Dependencies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.262761Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:ed3d2ba21cbc336c3f51e952bfafb33743533397136dec8ab243fca276937d14","observation_id":"068cf1d7-7f45-4414-a4b1-7db80a11e364","resolution":{"observed_at":"2026-08-15T14:39:18.262761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.080931Z","title":"AAAI Conference on Artificial Intelligence , year=","venue":null,"work_id":"4870e81d-b22c-4717-9996-c6c36d9f4a54","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.267286Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:21db095b33792ac31094c886197b02679b52a9f06939acd0b5313ff583c9b082","observation_id":"14f7765e-f0c2-4d95-b874-b2dd21a4be76","resolution":{"observed_at":"2026-08-15T14:39:19.086276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.061137Z","title":"Proceedings of the 37th International Conference on Neural Information Processing Systems , articleno =","venue":null,"work_id":"20345181-1ffd-4649-940b-9ee02b959385","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.272953Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:21c6cb5c0d86bec5c1d32a0f5ccc6bd1b00b626444e541f54ce3622564605944","observation_id":"23c39edd-bddc-4ee3-a11c-98918278029e","resolution":{"observed_at":"2026-08-15T14:39:19.068323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.277783Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.277783Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:aca74bf275b4930cf099d677e14dcba5a21eae14cc1dd41090e3df8c859b8c03","observation_id":"9c8e705f-8870-49fc-9ad2-ebe22dc20016","resolution":{"observed_at":"2026-08-15T14:39:18.277783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T14:39:18.284319Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.284319Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:7567a714b7c562045682914035ccc7a4db36f794b17c5d75b4c882b87a34016b","observation_id":"9a8d2a32-6d35-4dcc-a34c-982f5f57ddba","resolution":{"observed_at":"2026-08-15T14:39:18.284319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.289534Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.289534Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:749958d65ff3faa9b9998f7725db5861c315d3c26275e02ea62a7fe58cdc8035","observation_id":"2f7b9722-6608-46af-8395-362f5039b842","resolution":{"observed_at":"2026-08-15T14:39:18.289534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.294174Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.294174Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:408d7bfefd1ff2c69e6880d1395d45f083caa6ed136a3a64d579aac7c533f8ff","observation_id":"b45d4986-e646-41c3-bde9-6c52bac9508d","resolution":{"observed_at":"2026-08-15T14:39:18.294174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:19.010689Z","title":"ArXiv , year=","venue":null,"work_id":"37454db2-58dd-4364-82da-67789ffb6b29","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.299668Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:49198e7e2ef08442a65397b72f5537bd47d8a36c1e0f8cdcfa2cd71e6431efd3","observation_id":"5b585f6d-0d2c-489a-8b1f-e72b224ff1f3","resolution":{"observed_at":"2026-08-15T14:39:19.016311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.992566Z","title":"and Hu, Wei and Lee, Jason D","venue":null,"work_id":"72926eda-5da9-46b0-a8d1-c721efc35b9e","year":2018},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.304807Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:8849af0ede8632e78725c324d7a2d681e893502246ffa973bb4382cb8853307d","observation_id":"aa5540ea-bd45-4b08-9017-ac9559d068d4","resolution":{"observed_at":"2026-08-15T14:39:18.997570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.310228Z","title":"2022 , journal=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.310228Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:6e9c729150c430e31f182fd28f30f5ce2d1a6d89285b83b0d70b063923a72336","observation_id":"f437a744-300c-42be-bb1a-ee39277e3456","resolution":{"observed_at":"2026-08-15T14:39:18.310228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.965750Z","title":"ArXiv , year=","venue":null,"work_id":"17b483eb-5353-4c4c-a610-1280481117c9","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.316089Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:d181985ec5fc981479af12cc26830c2046e6011af008fe75890d40f6e09b46eb","observation_id":"7163e939-6afe-489e-9b05-27f555586377","resolution":{"observed_at":"2026-08-15T14:39:18.970434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.951527Z","title":"2025 , eprint=","venue":null,"work_id":"c5aca645-f79a-4e04-bf09-caa86701f69c","year":2025},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.321322Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:8e92ce2c79e3207401661e1a18ac054932d21f2fb46c94142339c499bad5f528","observation_id":"d1602f52-1aff-4bea-b548-b596476f0b21","resolution":{"observed_at":"2026-08-15T14:39:18.956155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.327189Z","title":"Attention is not not Explanation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.327189Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:2f5c880167d3140611065cac220d765f85088a2bca1f3987dc17965b5cf9aa31","observation_id":"e2296ce4-2ff9-4269-9729-6c34e0085c92","resolution":{"observed_at":"2026-08-15T14:39:18.327189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.936488Z","title":"North American Chapter of the Association for Computational Linguistics , year=","venue":null,"work_id":"8d383ef5-835a-4241-a1b3-55e84c92a0e3","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.332384Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:a25807507abd95f44950db5d92189643e9c1f4b5e12f03aa37f9ff170bfaf5f0","observation_id":"521285b6-e782-406a-bf6d-d1f40b979d6a","resolution":{"observed_at":"2026-08-15T14:39:18.941436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.338319Z","title":"Is Attention Interpretable?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.338319Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:e33ee1b12958ab24d4eba47e59f50a7ef9b294cde8315605634630670cf5ad3f","observation_id":"07c2fcb9-a389-46bd-834e-4e59d86f645a","resolution":{"observed_at":"2026-08-15T14:39:18.338319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.919890Z","title":"2024 , eprint=","venue":null,"work_id":"e0f5d833-4bb5-4e03-a474-84316aba604b","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.343703Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:d3b1c4ede803646f51cde6389c62541b340d329d26008592053c717478177781","observation_id":"300fb36e-0524-4fe8-af54-54b6a7c665d3","resolution":{"observed_at":"2026-08-15T14:39:18.925397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.904293Z","title":"ArXiv , year=","venue":null,"work_id":"3559e5e2-f621-4b9d-ab4e-6ac1c31a20ea","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.348421Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:a7d93ba44c45e2950199d790d08451a6ced4d3c0f01aef2eaf170155159dc751","observation_id":"68feb1c8-a306-497d-a414-4a0f00296363","resolution":{"observed_at":"2026-08-15T14:39:18.909569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.886645Z","title":"Proceedings of the 41st International Conference on Machine Learning , articleno =","venue":null,"work_id":"364ed4cc-0b0c-421b-8b3a-1b74687bc5c2","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.353396Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:7da41d978ba61dbe1817a971a6713fca10ddd532e64cae4ae98de76e60bb6cbe","observation_id":"381831d6-f1f6-428a-a8e6-5cfe10bfe1cf","resolution":{"observed_at":"2026-08-15T14:39:18.893694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.867107Z","title":"Transactions on Machine Learning Research , issn=","venue":null,"work_id":"787f1aef-6aba-4b25-803b-a5d978c16c24","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.358371Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:6241b52e082c337fe8c81f83c72c08d1489c67408becd87954bd5c469fba5a56","observation_id":"18b0ed52-e575-4366-87cd-110ff5be9c6c","resolution":{"observed_at":"2026-08-15T14:39:18.874535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2025/760","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.462311Z","title":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence , articleno =","venue":null,"work_id":"eb34be04-1468-452e-9002-78103d1ba254","year":2025},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.362713Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:50aa10bec6e80fa748edc415f5bf84749f668648c6fdfc113109e1092f76e4dd","observation_id":"15745298-06e3-45ef-afa0-a94c60961d3f","resolution":{"observed_at":"2026-08-15T14:39:18.468085Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.850086Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"d444abc1-75dd-4d72-a4a1-d78002ccbf31","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.367236Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:e5d0ac70476868049d357bdaf4f975aff0fc01f9c3f5ea6c0270ad4a017ad8f8","observation_id":"44b4543b-df80-4580-911e-9d83d571ef11","resolution":{"observed_at":"2026-08-15T14:39:18.854925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3233/faia230541","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.441743Z","title":null,"venue":null,"work_id":"127bfc03-6b22-41fa-b16d-8b851cd7982e","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.371684Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:49043572fccc7f2ec34a9c0e80c8ff4a6b697095acf28a9723ba9756ea8c4a16","observation_id":"9e226e27-f37b-4687-8bf0-40f6d8272bc6","resolution":{"observed_at":"2026-08-15T14:39:18.448554Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.830789Z","title":"Proceedings of the 37th International Conference on Neural Information Processing Systems , articleno =","venue":null,"work_id":"b324c4dd-ac65-46ba-a9fa-5fce030afaae","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.376632Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:576e42c3384164c3d7c28b2ac76027f94cebad4a02d1e153afd94ab1e6afecdc","observation_id":"c9a9e8f5-7966-4a6f-992f-1ef36ca5cdb3","resolution":{"observed_at":"2026-08-15T14:39:18.835752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.807849Z","title":"Proceedings of the 38th International Conference on Neural Information Processing Systems , articleno =","venue":null,"work_id":"404c555a-eca6-468b-b7d5-10dbe50dee0f","year":2024},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.381279Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:4444d7b8096ceb9b5a4339edcf0a88df5aa5d7788ed5d5d5ae765bd650bdd8bd","observation_id":"3b8a100d-98f6-4ca0-a665-cff24368d6fa","resolution":{"observed_at":"2026-08-15T14:39:18.818156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.791956Z","title":"Proceedings of the 40th International Conference on Machine Learning , articleno =","venue":null,"work_id":"e6a198ea-4028-47bf-a212-07b248a84230","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.385781Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:86c8977d03d7446d7c0db3eab0542206a972db2980ea38b929be2bc617fab68d","observation_id":"af580012-a011-4851-bec7-bd87cb694164","resolution":{"observed_at":"2026-08-15T14:39:18.796993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.390155Z","title":"Quantifying Attention Flow in Transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.390155Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:7ad1ebbd891d242abc18fc488f202ea1715a8f1fa29269203a206a0383bd959c","observation_id":"cd807fa5-061e-4dba-b80b-2eb806503025","resolution":{"observed_at":"2026-08-15T14:39:18.390155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.394573Z","title":"ERASER : A Benchmark to Evaluate Rationalized NLP Models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.394573Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:79900acd0701a3da1ed553df827ede579a525f33b8100b5192d78c7875a546b2","observation_id":"b166557b-8498-4d35-bc1e-b76757058ca0","resolution":{"observed_at":"2026-08-15T14:39:18.394573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.770101Z","title":"Proceedings of The 14th Asian Conference on Machine Learning , pages =","venue":null,"work_id":"cfc71cd5-b244-4831-acfd-1567f05249f3","year":2023},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.398617Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:bb9cf73ff8ef896979716fac4a783d2c91339c8be72f5878505586917ebfd2ca","observation_id":"de0c266e-9a1d-4525-b9c9-abda41873ce3","resolution":{"observed_at":"2026-08-15T14:39:18.778188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:18.752606Z","title":"European Conference on Artificial Intelligence , year=","venue":null,"work_id":"d07b9cb6-86fc-499e-9239-34df6348773f","year":null},"citing_paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:18.403313Z"},"links":{"citing_paper":"/paper/2608.06776"},"observation_digest":"sha256:e49a85f6233da0c2d634abfb64c3b5b8bd46a463a9f55ec10eb80a7dbb45c022","observation_id":"45bb5563-3142-4a07-b98a-769964221409","resolution":{"observed_at":"2026-08-15T14:39:18.758095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06776","last_updated":"2026-08-07T03:52:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T14:27:35.744820Z","submitted_at":"2026-08-07T03:52:01Z","title":"Faster Query-Key Learning Sharpens Attention in Self-Attention Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":3,"verified_fuzzy":39},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2608.06776."}