{"as_of":"2026-08-14T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4f8682fd772330ae0c1a713f858f8d6eb1649c2bd97a3155542cc7fc1e1489f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:26:31.193173Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14095/citation-record","integrity":"/paper/2506.14095/integrity","json":"/paper/2506.14095/citation-record.json","paper":"/paper/2506.14095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.913751Z","title":"Attention is all you need","venue":null,"work_id":"abf2fea2-c56e-4539-9178-ba158090299a","year":2017},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.715156Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:7992d72a973967182b1d6cb9e780155e210bcb841a203c5695a4959efb571c1c","observation_id":"62771866-b7fa-4835-8861-4c85f607bed9","resolution":{"observed_at":"2026-08-07T00:26:33.918906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.897605Z","title":"Are transformers universal approximators of sequence-to-sequence functions? In International Conference on Learning Representations, 2020 a","venue":null,"work_id":"444f119d-d201-4aab-bc31-09fc9ccf8ce8","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.776075Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:298655660179dba4882d83a9f6ce9c2f3b32587b4a755ca7f61d4d8cfac27da5","observation_id":"22bb8517-1758-44a3-89d5-f49376359346","resolution":{"observed_at":"2026-08-07T00:26:33.902339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:30.865774Z","title":"Efficient transformers: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.865774Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:e8b9605f2750705e692c935192dfcc62df006c6f4ec07a1c0f1e290fb6eb6572","observation_id":"8e9223ce-1562-43b5-a3cb-18c05d591716","resolution":{"observed_at":"2026-08-07T00:26:30.865774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.883195Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":"c1e9ade0-1128-45ae-95c2-afe58a5886ae","year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.878995Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:96165f24d4ce36b8dbcc5ee56f77f6eb6606e97cc1466f7b25a9353a8359fbca","observation_id":"1af2cb21-31bf-4ab7-b069-681e4b50bdc6","resolution":{"observed_at":"2026-08-07T00:26:33.887632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.869209Z","title":"Cognitive Mechanisms Associated with Auditory Sensory Gating","venue":null,"work_id":"d8ecf990-d60d-4225-bc79-9702ef633074","year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.884261Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:ab0d4b4e56b84382099ebe132f1153bda62ef00b4feddf2cc5653ad4e458b21f","observation_id":"59ba69a1-cbbe-4543-97ca-d997251586a1","resolution":{"observed_at":"2026-08-07T00:26:33.873539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.854962Z","title":"The Senses: A Comprehensive Reference","venue":null,"work_id":"d557d810-d4b3-4fa3-a14a-0df44844495c","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.888896Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:7abd684f42d5124304a4bd3a1f8f26d6009d27c2b4215fcbe5b09063233d665d","observation_id":"44f6baf5-da5e-402a-83b1-a523095912f5","resolution":{"observed_at":"2026-08-07T00:26:33.859632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"gov/1554034","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.730109Z","title":"Sensory gating deficits in schizophrenia: new results","venue":null,"work_id":"ef423059-e46c-4180-b9d4-fdeb058c49d6","year":1992},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.894305Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:c253e03df30d53ef885232d4a3155106264f36e9d566c68c7fe5c6c8da00d150","observation_id":"21ace225-81de-41d0-821b-fd63afaeb096","resolution":{"observed_at":"2026-08-07T00:26:31.888917Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.08568","last_updated":"2019-12-02T22:53:39Z","snapshot_observed_at":"2026-08-14T20:29:55.969792Z","submitted_at":"2017-09-25T15:59:11Z","title":"The Consciousness Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.08568","snapshot_observed_at":"2026-08-07T00:26:30.899429Z","title":"The consciousness prior, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.899429Z"},"links":{"cited_paper":"/paper/1709.08568","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d84a9eb98e1226202f5d529aa7a5877655964f8c698bed61bdf3dcba3e6e33a1","observation_id":"f4952284-fd8e-4da6-b4c6-88f49606b297","resolution":{"observed_at":"2026-08-07T00:26:30.899429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.840724Z","title":"URL https://neurosymbolic.github.io/nsss2024","venue":null,"work_id":"fec3ccc5-0882-439b-99b7-a51b22dafb58","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.910069Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:f99318c0206f5bc3556091c5df4d975493a4dbc7cfbd5022131b09d0c215efe1","observation_id":"b2232304-32ec-42e8-a934-7a304b29b1c2","resolution":{"observed_at":"2026-08-07T00:26:33.845025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-07T00:26:30.917132Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.917132Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:069fb39fb99d04fa6188336648f20a6da60a9b91cbff2fa21c622fb1a9bb920d","observation_id":"14e85bea-67d9-43a4-a785-ab7f32ae9204","resolution":{"observed_at":"2026-08-07T00:26:30.917132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.826609Z","title":"Neural networks and the chomsky hierarchy","venue":null,"work_id":"c019b145-0673-40df-a62f-2e05fcb98f4a","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.922213Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:614a541242f49a3ed3715064b6a5efc604198f340270fe8509edf0b31cd5a6be","observation_id":"a9fff3c4-0fbf-4b1b-a1f7-c3f9fc251544","resolution":{"observed_at":"2026-08-07T00:26:33.830872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.807253Z","title":"O(n) connections are expressive enough: Universal approximability of sparse transformers","venue":null,"work_id":"3edb232d-e4e1-4b1d-afd0-999c4ed7ce58","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.926723Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:62b9a21a59c881109de39b6408717787f0cdeb93ae20716a33a5d4f61456b7ad","observation_id":"a66a7ba5-854b-43ff-9bbe-e3ff87789bc5","resolution":{"observed_at":"2026-08-07T00:26:33.812327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.789598Z","title":"Etc: Encoding long and structured inputs in transformers","venue":null,"work_id":"b3d69ebd-f9ab-4cc3-a210-5ea31bc85530","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.931698Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:2bf6dfe64402bce263df3e206b9eaf1773c2f3aa124cbb7fffaac5d51bd07ac7","observation_id":"61af9724-2b54-4a43-8217-c53f99349493","resolution":{"observed_at":"2026-08-07T00:26:33.794142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.774041Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"c82bb40a-598d-4090-8368-48555dce7b44","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.936249Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:8a213fe684cbb516e2da018b58c609038bd1f05a456c880f3de465ffc8a02bd8","observation_id":"84ce2eca-690d-4bb7-a2aa-9ea0dff21b3f","resolution":{"observed_at":"2026-08-07T00:26:33.778932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:30.940576Z","title":"Memory-efficient transformers via top-k attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.940576Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:97b15975eafedefee7af34464c9374d26cbb23ec78cefbbdddc2e7a4f0b5552e","observation_id":"32f6bc68-148f-4bae-a696-780ff6753dc3","resolution":{"observed_at":"2026-08-07T00:26:30.940576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.759978Z","title":"ZETA : Leveraging z -order curves for efficient top- k attention","venue":null,"work_id":"46c312e1-f97d-4132-bc2f-d2a59447b1a8","year":2025},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.945255Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:09f82adc578a3891a0d45fdfc172d138680333def55af18ec1b679725d167a93","observation_id":"2f42847e-789a-4545-ad74-dbd1c9a601cb","resolution":{"observed_at":"2026-08-07T00:26:33.764128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.746325Z","title":"Algorithmic stability and generalization performance","venue":null,"work_id":"479a425d-1996-4ac3-afc6-860ece39570a","year":2000},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.950382Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9b066c349a6564c4440ae88adec1a7fb915af8eddd97a3eb33749e69dbbe4bed","observation_id":"672ff6cb-90c5-4c82-99a3-f10cd42cd3a6","resolution":{"observed_at":"2026-08-07T00:26:33.750849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01240","last_updated":"2016-02-07T17:06:58Z","snapshot_observed_at":"2026-08-14T22:33:52.090275Z","submitted_at":"2015-09-03T19:53:40Z","title":"Train faster, generalize better: Stability of stochastic gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01240","snapshot_observed_at":"2026-08-07T00:26:30.954810Z","title":"Train faster, generalize better: Stability of stochastic gradient descent","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.954810Z"},"links":{"cited_paper":"/paper/1509.01240","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:8f8b5bc453dd116c182e8e930bb19d8e4df5515ce49705c9f1a96ab8b52aaef3","observation_id":"8495391a-4fb7-4739-ac0c-aec66433f718","resolution":{"observed_at":"2026-08-07T00:26:30.954810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09238","last_updated":"2022-07-19T12:49:02Z","snapshot_observed_at":"2026-08-14T21:45:19.757174Z","submitted_at":"2022-07-19T12:49:02Z","title":"Formal Algorithms for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09238","snapshot_observed_at":"2026-08-07T00:26:30.960292Z","title":"Formal algorithms for transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.960292Z"},"links":{"cited_paper":"/paper/2207.09238","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:b54e25be6c0b7c23cb494ac990677b318e5c24e7f04e0956fa27850f3f968435","observation_id":"9bb6606d-3f55-472b-a431-4d0742abc47c","resolution":{"observed_at":"2026-08-07T00:26:30.960292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.732540Z","title":"A survey of transformers","venue":null,"work_id":"058f6373-51df-4bcb-a84f-42c55ae904d2","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.965609Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:4b47936cd24c6c7a389de925f5ee5a3d71a3cdf3dac444ea9c674bf25f847f21","observation_id":"dd34a3bd-096a-4936-9e29-698e87b2df1d","resolution":{"observed_at":"2026-08-07T00:26:33.736787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.719086Z","title":"Image transformer","venue":null,"work_id":"3865674e-437e-4170-a450-7788ee559d2a","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.969645Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:ecef7c1185f5cbe3f5f603cc2003492ebad1fe208585dd41ab7f769c640eb807","observation_id":"c1bfa5c9-f0c9-4ec2-9862-5b35f64ee4ca","resolution":{"observed_at":"2026-08-07T00:26:33.723660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.703415Z","title":"Blockwise self-attention for long document understanding","venue":null,"work_id":"42d27df5-5afc-4d34-a431-6d03f5bf0603","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.974200Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d3f721bcb07fe803d67f22a94219df0a1627e262332a246bdacda21fad4d6c5d","observation_id":"79b46b3c-40a9-4820-be5e-130bc2e701cb","resolution":{"observed_at":"2026-08-07T00:26:33.709229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T00:26:30.979069Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.979069Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:3ef6f3079ce3bc19061710b8578faeb3b76e2e80b70074ec0238737dda201afc","observation_id":"f63968ca-efc8-419d-878a-ddb05d57f944","resolution":{"observed_at":"2026-08-07T00:26:30.979069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T00:26:30.983693Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.983693Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:af618944137a9707946ad2e9bca0b3be46ddf45c9d8662cbfce3e4ebbcd294bc","observation_id":"067581ba-98c3-4144-b6bb-576ff06f2877","resolution":{"observed_at":"2026-08-07T00:26:30.983693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.688611Z","title":"Sparse sinkhorn attention","venue":null,"work_id":"8dc79a5b-d4d2-4e60-a0d8-a8ad6e6c5bb2","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.988852Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d18d14f9aa3ae9db59277ade097b21fc59d059164e816095dd64baa79cdb7419","observation_id":"de423e8c-14cf-431b-bb13-0d340ddd288b","resolution":{"observed_at":"2026-08-07T00:26:33.693446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00353/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.350722Z","title":"Efficient content-based sparse attention with routing transformers","venue":null,"work_id":"fa180985-9dbb-453d-b8ac-3a8e2507a20e","year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.993269Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9fae292ff29e02ab851aa1912a7bb3d7e11f61bb0a97fe51727ea16533a30cbf","observation_id":"8cee7eee-810c-4efa-84d8-49e5f85f3321","resolution":{"observed_at":"2026-08-07T00:26:31.355960Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.674180Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"7fa0fcc4-586d-4cdb-9af8-41e264e328f7","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.998380Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:36f9facd1a4ec12bbf3d07016b94ad510aa35016a74204a7c13278b0eb2aca38","observation_id":"2e7434e7-0ad7-45cb-b59f-e14f2167eae9","resolution":{"observed_at":"2026-08-07T00:26:33.678445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.659125Z","title":"COGS : A compositional generalization challenge based on semantic interpretation","venue":null,"work_id":"8f563119-4be9-4de6-acb6-ff337bd9fbb9","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.003042Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:2e828c1865e3f345b7b2a2ddd332ce0b06d85b2978aebf7d0b3b6ed9368bb522","observation_id":"d84cf548-c9c4-4cf2-8365-00a069fe0a17","resolution":{"observed_at":"2026-08-07T00:26:33.664182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.645282Z","title":"Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks","venue":null,"work_id":"2089e117-18e9-4384-9a5b-01a63937f53c","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.007490Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:8e5a90de6783cbd40cb5599a7389fe893ac0e464047e68cfae39fb86b92bf19f","observation_id":"cf06c895-63e9-4ecd-978e-e546c4c82dde","resolution":{"observed_at":"2026-08-07T00:26:33.649685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.41","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"When can transformers ground and compose: Insights from compositional generalization benchmarks","venue":null,"work_id":"ad50e0a8-a48e-4522-95c9-f4cf7a6791d1","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.011682Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:712d588e5fd7fd52ea395a5a97378718a8b2b61c088b0dad53ed95cbbb03356b","observation_id":"47980f98-7844-48dd-9fd5-0af02175dc94","resolution":{"observed_at":"2026-08-07T00:26:31.339636Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.016326Z","title":"The devil is in the detail: Simple tricks improve systematic generalization of transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.016326Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:81674ccba0b982d077b79181de693ccd2d79b5b291b1222187f8a9d73ed8d7fa","observation_id":"3ceab004-66f3-41e6-84d4-824a19b41134","resolution":{"observed_at":"2026-08-07T00:26:31.016326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.251","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Making transformers solve compositional tasks","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"4ec61d5b-c414-4e19-b4c7-a44c06e73b3a","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.020431Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:fd5042a578b6ac67db846d2dfa1ba3f24701d8e571a60cc7752301ae802e6c7b","observation_id":"a13d6515-33e0-4e1d-91c8-7e541b43e13d","resolution":{"observed_at":"2026-08-07T00:26:31.312207Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.505","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Inducing transformer ' s compositional generalization ability via auxiliary sequence prediction tasks","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"35611d00-e78d-41f1-a242-270b16439ec9","year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.025449Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:029f49a33e600071a8f42a461c93736320afc9383debbfb42791f796a7fb7d67","observation_id":"2496269a-85e9-44eb-a5db-d03f7139143a","resolution":{"observed_at":"2026-08-07T00:26:31.295252Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.631314Z","title":"a rli, Ekin Aky \\","venue":null,"work_id":"9a7128ce-535b-4364-a008-668f1d8788fe","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.029829Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:da2bb6f723321a24f4834e60517cb214a2cf9ca44ec563f80a72c7a0271590c4","observation_id":"84412c7a-508f-461c-a335-db1b31394c91","resolution":{"observed_at":"2026-08-07T00:26:33.635646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00663/120983","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.274007Z","title":"What formal languages can transformers express? a survey","venue":null,"work_id":"52ae9c8b-1f70-4ccd-9b4a-bd67b9c4520c","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.034312Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:3fd52343cc5491f9e95592db5706f49a4662a478a4f7b76c3a8fb9c825383d8e","observation_id":"f5b2bfd4-f7c9-4872-a2ad-f00fdeacdc96","resolution":{"observed_at":"2026-08-07T00:26:31.279003Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.616207Z","title":"On the ability and limitations of transformers to recognize formal languages","venue":null,"work_id":"d5322439-326f-45b4-b1e7-4b1a88d71c53","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.038652Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:41459076c4aa8ee96f43fcd026fef683edfdba568fb85e256e6b32f15b38a3e4","observation_id":"6020b2e6-aa1c-47ce-8d90-8afc314dd586","resolution":{"observed_at":"2026-08-07T00:26:33.620841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00306/43545","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.258238Z","title":"Theoretical limitations of self-attention in neural sequence models","venue":null,"work_id":"2e3aead6-c224-4a91-8558-c2e2639e6c7f","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.042758Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:5b5c6a86000345607624f9a0f794502031fd0141c1e91fe1f717b3d8983b62f3","observation_id":"1604f60a-e988-4af0-8874-2c4f77626b61","resolution":{"observed_at":"2026-08-07T00:26:31.263821Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.599976Z","title":"Formal language recognition by hard attention transformers: Perspectives from circuit complexity","venue":null,"work_id":"d3642857-6987-47f7-9bc9-1ec841fc7049","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.046942Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:49f392b0a07fd1d5f3069841006892b2456074b6aa01a71e223f85d313cbbd53","observation_id":"2ece83c2-9f63-418c-b1d5-c8ae82a60982","resolution":{"observed_at":"2026-08-07T00:26:33.605490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.585063Z","title":"Saturated transformers are constant-depth threshold circuits","venue":null,"work_id":"ec1e47bf-0553-4797-a6c1-37ababb9ed32","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.051326Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:b9ba766a9077cd955b2ff63f27d45d8ca48576388ab99ca3b6be2c1b99732c14","observation_id":"bb1ab5b5-9b8c-400a-b686-8b77247e18c6","resolution":{"observed_at":"2026-08-07T00:26:33.589814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.568897Z","title":"Overcoming a theoretical limitation of self-attention","venue":null,"work_id":"f81240e8-d249-4696-b3de-1e0546bead91","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.055666Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:0aaa18695292fbdd383ee16d0201ce367d2343b44632c3b64a2ffd387e772ce2","observation_id":"f3fe64ff-55f2-46e6-80d0-57bf72a7230a","resolution":{"observed_at":"2026-08-07T00:26:33.573709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.553378Z","title":"Tighter bounds on the expressivity of transformer encoders","venue":null,"work_id":"397d5a21-1549-4e69-8ca7-ec1ae6560d49","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.059942Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:35d4acffab6cdda978ad10d2d8103f4265ac76fde32f3ce5e4e852111e1d1c55","observation_id":"5f80651a-9042-41df-8507-c06510ced51d","resolution":{"observed_at":"2026-08-07T00:26:33.557973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.538895Z","title":"Transformers as algorithms: Generalization and stability in in-context learning","venue":null,"work_id":"0a2fb12f-da74-400a-a546-69fe9a1a947c","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.064187Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:6475a70dfa807c71a96b3ebacb686234567f15e5f46a4d0bc4fefba6e69c80f4","observation_id":"e1a1abc0-80ea-4abc-a8b7-530e386ed594","resolution":{"observed_at":"2026-08-07T00:26:33.543429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.524804Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"ee5bb2fc-9887-4cca-b877-d72eac33c1d5","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.068351Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:74a067802d061309ecc575511d1c21c24a66d908b45e63d8c0dcffeabf52e03a","observation_id":"af5cac0e-1cef-4924-a631-3d6f7a36699f","resolution":{"observed_at":"2026-08-07T00:26:33.529452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.509429Z","title":"The emergence of clusters in self-attention dynamics","venue":null,"work_id":"2d626b52-62b5-4b45-887f-9b70a573f808","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.072620Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:b74ffb8cac36952fe7f17ba7d22843b2ae58b8642a2ce8690a128a121f7c7161","observation_id":"bc5a2ec6-5e4e-4209-8bbe-586adb9acbe7","resolution":{"observed_at":"2026-08-07T00:26:33.514809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.490838Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"89b4c47c-75f6-477b-bd01-c56bf304819f","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.077091Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:c73f90d4937326b894cf299a1817a5ff24c10b548b4e54dd673eb7503c4b66ba","observation_id":"4842f956-d2c0-4cd2-bf07-6a05324354e0","resolution":{"observed_at":"2026-08-07T00:26:33.495826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.475470Z","title":"Trained transformers learn linear models in-context","venue":null,"work_id":"00f35485-8426-4a0f-85be-9747aeaf0564","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.082054Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:5443e7b5a769388300d94871c9705b95d79ffe92453b5b9b8289008602ae5200","observation_id":"0676e91a-49e1-44af-9ffe-d180a49e2d1e","resolution":{"observed_at":"2026-08-07T00:26:33.480464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.458951Z","title":"Why are adaptive methods good for attention models? Advances in Neural Information Processing Systems, 33: 0 15383--15393, 2020","venue":null,"work_id":"462bcdc4-a193-4245-b047-30340affe3e9","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.086492Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:5df6368e0243ba5f672be2b09ead71545f876386afd325ccf7874a6ac6a021d8","observation_id":"f1208b8e-f112-4011-bd87-dd3159dc5249","resolution":{"observed_at":"2026-08-07T00:26:33.464242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.440949Z","title":"Toward understanding why adam converges faster than SGD for transformers","venue":null,"work_id":"1a74ad8d-35b4-4be5-b2ae-72e12203f7ef","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.091192Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:653b666b2a8a2f6d6d5fe0132cb0bd5d2a9cd714d7b964c600d80701ae7a31f1","observation_id":"da9fc738-70f8-48b4-8259-7545c05251a4","resolution":{"observed_at":"2026-08-07T00:26:33.446017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.425758Z","title":"How does adaptive optimization impact local neural network geometry? Advances in Neural Information Processing Systems, 36: 0 8305--8384, 2023","venue":null,"work_id":"640d0386-3d4c-4631-adc9-04f132b23322","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.095922Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:2a272af7d0a5f4fb2c9365cfd639e12e5738b063fe7734a2304ac4a479063301","observation_id":"c9f67186-e199-4d0c-9ad6-15fa02f759f1","resolution":{"observed_at":"2026-08-07T00:26:33.431099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.410161Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":"af189c8f-4828-4909-ac9a-aad98ef1e713","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.101370Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:231b91c7781f6d8d8a889604b70c3e1403651af7f61e593d2294188fe1cca471","observation_id":"dbc1b7cc-1d95-47c1-85fa-4b50bf0a234a","resolution":{"observed_at":"2026-08-07T00:26:33.414833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.393990Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","venue":null,"work_id":"225fb56e-1576-4a10-93d9-e803bb6abce0","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.105944Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:7c241c51b31b5eeba00d082534747187914ad96f75815e426261b05db978f3ca","observation_id":"884fe00e-92a9-460e-848e-cb3bd47f188e","resolution":{"observed_at":"2026-08-07T00:26:33.399313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.377732Z","title":"On the optimization and generalization of two-layer transformers with sign gradient descent","venue":null,"work_id":"9ca4a32f-1d91-473e-a92a-39f72cd84689","year":2025},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.110777Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:5a492716954512e0b4a558c82544301555baa82e9e8ac883b711306d88bc067b","observation_id":"0b632e26-88f9-40fd-b30c-2f0591d3f489","resolution":{"observed_at":"2026-08-07T00:26:33.383165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-14T21:47:20.783705Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T00:26:31.114796Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.114796Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:7b591f3889396bed5c6993615a17ec58af27490d8ba1a59f4568a55aec8ad807","observation_id":"7d1005fb-2019-4208-b0c1-d3163e3f2a97","resolution":{"observed_at":"2026-08-07T00:26:31.114796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.119039Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.119039Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:6b7971fc4568371ec2068cf8c024e7cd70ed2b820ee6bc6896ecf801d82c97ff","observation_id":"46115e48-be86-45ce-b49a-e9ce4bdda4f9","resolution":{"observed_at":"2026-08-07T00:26:31.119039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.123158Z","title":"BERT : Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.123158Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:53b2c825c65ffba16f37221483941219f5d057a5dd1e742f461cb356fd049bc9","observation_id":"ee4e4e51-cd62-4925-9254-1f342c52ca72","resolution":{"observed_at":"2026-08-07T00:26:31.123158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T00:26:31.128361Z","title":"Bridging nonlinearities and stochastic regularizers with gaussian error linear units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.128361Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:52d9ae33f4a4f35ad7a64b70af7ce806eebe72f6b2110bdb11e2e2864f4d38f5","observation_id":"d1ad7295-411a-42bf-9db6-42b3ff685421","resolution":{"observed_at":"2026-08-07T00:26:31.128361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-08-14T22:21:43.095256Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-07T00:26:31.133288Z","title":"Fast and accurate deep network learning by exponential linear units ( ELU s)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.133288Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:21d75221575c990d9cbc820743c874522ca7a26707629200bf533ebf0b1c349c","observation_id":"d521b3a9-96a1-4475-9a3a-d3942c18b279","resolution":{"observed_at":"2026-08-07T00:26:31.133288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.351104Z","title":"Listops: A diagnostic dataset for latent tree learning","venue":null,"work_id":"067e92d5-bea5-4d53-8f49-6dd3b032409e","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.141387Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9966e98fbe69ee699c9ef2509741c462df85b1904d25831e71054af310d9b35a","observation_id":"5fa87b52-75d6-4f21-b69c-f76cc01c4f8e","resolution":{"observed_at":"2026-08-07T00:26:33.356077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-08-14T11:29:52.289341Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-07T00:26:31.146060Z","title":"Mish: A self regularized non-monotonic neural activation function","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.146060Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:7a6027a83558a72bbae1f4024a138fd1bc96ce5ea91221447f2d0c18903f4039","observation_id":"bfb46c1d-85a6-4889-b1b2-37873f04faca","resolution":{"observed_at":"2026-08-07T00:26:31.146060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:26:31.152690Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.152690Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:1548587970a861aa13eddc5aaeb2dfbfe239d0686387c4a4ee146136c4f296fe","observation_id":"7a944d61-2998-44b7-a34b-676ba1b45bf1","resolution":{"observed_at":"2026-08-07T00:26:31.152690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04710","last_updated":"2021-06-09T14:13:40Z","snapshot_observed_at":"2026-08-09T03:44:50.853055Z","submitted_at":"2020-06-08T16:08:38Z","title":"The Lipschitz Constant of Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04710","snapshot_observed_at":"2026-08-07T00:26:31.158224Z","title":"The lipschitz constant of self-attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.158224Z"},"links":{"cited_paper":"/paper/2006.04710","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:1512a524ce423fdce8310a6f7506ca0c6fa03173af7a08b85fb3fb0286c156db","observation_id":"1c0085ca-f463-4103-952b-307c15eb115e","resolution":{"observed_at":"2026-08-07T00:26:31.158224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.11637","last_updated":"2019-12-25T10:59:31Z","snapshot_observed_at":"2026-07-06T08:46:56.770342Z","submitted_at":"2019-12-25T10:59:31Z","title":"Explicit Sparse Transformer: Concentrated Attention Through Explicit Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.11637","snapshot_observed_at":"2026-08-07T00:26:31.162921Z","title":"Explicit sparse transformer: Concentrated attention through explicit selection","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.162921Z"},"links":{"cited_paper":"/paper/1912.11637","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:286fbcd6ac2fda0948f1fffdba593fb42a78d01fcbacbf11edfab98836610ee3","observation_id":"12797a98-aa4b-437c-b189-96d7d2b884b1","resolution":{"observed_at":"2026-08-07T00:26:31.162921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.098493Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":"f1f55141-0a9b-40fa-ae53-4df420d32d02","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.168150Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:cdda4c2c096ec2cad986ee8358a442f424c40a20b9a346ad0bce78618ab65b65","observation_id":"37334c11-9643-4161-800f-94b4c7a6bbe5","resolution":{"observed_at":"2026-08-07T00:26:33.275494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.862297Z","title":"Never train from scratch: Fair comparison of long-sequence models requires data-driven priors","venue":null,"work_id":"766627a4-8831-4181-92ea-450d0a6ab032","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.172682Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:cbbe17371c75eb0ea23ee3f37b1cddeba10d3ff68ad98a0f387ff84fb4c8afe1","observation_id":"10878189-944f-4b9b-8f6c-9907c722def7","resolution":{"observed_at":"2026-08-07T00:26:32.980495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.730311Z","title":"Learning overparameterized neural networks via stochastic gradient descent on structured data","venue":null,"work_id":"cf571d99-dfe1-4ba7-aaaa-2bd6fbbf1df4","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.177991Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:879d7a94aef17fd0eeb6e55fba3576a0dc0f2c7d22e13136ca92a650514b367d","observation_id":"c25273f1-6b34-4339-bc1d-998ffb03b3da","resolution":{"observed_at":"2026-08-07T00:26:32.851131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.446269Z","title":"A convergence theory for deep learning via over-parameterization","venue":null,"work_id":"002c8437-4a21-45c3-ad23-2beae30f114a","year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.182659Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:0962655c8761b447e44f54cf097750f89798a2442cd98b3bb1451819f76f1219","observation_id":"233ed32b-ea5f-4522-944c-d2bb9ef0050c","resolution":{"observed_at":"2026-08-07T00:26:32.582899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-019-05839-6.pdf","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.227629Z","title":"Gradient descent optimizes over-parameterized deep relu networks","venue":null,"work_id":"235715f5-c211-4695-ae2e-58ecd7f2d8e2","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.187525Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:599e0d7c6a70cd0be7ba4a8d22812220cdfef5147fbd4b5098661c2993c24543","observation_id":"ca681d40-ef8b-457c-962c-fffe1a113051","resolution":{"observed_at":"2026-08-07T00:26:31.234860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.115104Z","title":"Convergence rates for the stochastic gradient descent method for non-convex objective functions","venue":null,"work_id":"70e87b7b-e23a-449a-b2c0-516ff0deb38c","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.193173Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:77412a713eb49f3b50082edc9bcfc80764353cdee075d20219d61afb93655027","observation_id":"aa3a87b7-a9a4-47f5-a37e-2fd076f33f5b","resolution":{"observed_at":"2026-08-07T00:26:32.280375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T19:49:45.784799Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":7,"verified_fuzzy":42},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2506.14095."}