{"as_of":"2026-08-10T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41f466e42eae688d9cca65ab90b322470903093b7a077f16814d3baea62991d7","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T20:34:01.273009Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:41:54.830690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:09:59.046151Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-08-06T20:41:54.830690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03031","last_updated":"2025-07-03T01:05:24Z","snapshot_observed_at":"2026-08-09T04:21:06.565470Z","submitted_at":"2025-07-03T01:05:24Z","title":"On the Mathematical Impossibility of Safe Universal Approximators","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:41:54.830690Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2507.03031"},"observation_digest":"sha256:a20004086e45edb79bea2a7563e72b77d3ad6ba6e1634eaa55920307cf2a02bc","observation_id":"6280ffc3-a12f-40fe-9030-78aab512c9ec","resolution":{"observed_at":"2026-08-06T20:41:54.830690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-08-04T17:05:55.007461Z","title":"Nakanishi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-04T17:05:50.271239Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.007461Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:dd02a7e0dfb615b734b89ef0e1da6ad003f54f309518454e4f3a92bab8d3d35a","observation_id":"ecce2904-108a-4489-bac0-607d95f91640","resolution":{"observed_at":"2026-08-04T17:05:55.007461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-08-04T11:23:28.867756Z","title":"[PLS`25] Krishna C Puvvada, Faisal Ladhak, Santiago Akle Serrano, Cheng- Ping Hsieh, Shantanu Acharya, Somshubra Majumdar, Fei Jia, Samuel Kriman, Simeng Sun, Dima Rekesh, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05554","last_updated":"2026-07-30T05:50:28Z","snapshot_observed_at":"2026-08-07T13:47:21.858527Z","submitted_at":"2025-10-07T03:51:57Z","title":"Critical attention scaling in long-context transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:28.867756Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2510.05554"},"observation_digest":"sha256:1a887523e02b538798ab71a562f35c769290df362c8e13ce58bd8cae63f057df","observation_id":"e8ec1c17-07c2-4575-b098-96245eb944d3","resolution":{"observed_at":"2026-08-04T11:23:28.867756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:b89d5d882455b7aff414ba953b7c99673ee888f6dc22471f24926a0cd0bdb32c","observation_id":"6ad89e38-fc74-4506-91b7-74b7c349c60d","resolution":{"observed_at":"2026-05-14T19:12:24.763656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-08-03T09:57:48.435605Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.12145","last_updated":"2026-07-09T09:50:24Z","snapshot_observed_at":"2026-08-10T03:49:33.128464Z","submitted_at":"2026-01-17T19:41:23Z","title":"Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T09:57:48.435605Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2601.12145"},"observation_digest":"sha256:92b2d59e9157f88f3dd6799bd623506fdc1886027e125a421589ae51c4de2c52","observation_id":"547c0705-9c85-459c-bb4d-3885f7f86b6c","resolution":{"observed_at":"2026-08-03T09:57:48.435605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2603.22241","last_updated":"2026-04-13T08:19:37Z","snapshot_observed_at":"2026-08-03T01:01:53.602471Z","submitted_at":"2026-03-23T17:39:56Z","title":"MemDLM: Memory-Enhanced DLM Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T00:42:22.989588Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2603.22241"},"observation_digest":"sha256:5d847f9c9009fb4d9c1ba8168bbcecdb6c9b28669da210a607f00f775639fa0a","observation_id":"febb80e5-4542-49f1-b831-16c14a806b94","resolution":{"observed_at":"2026-05-15T00:43:24.547738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2604.01178","last_updated":"2026-05-07T15:58:45Z","snapshot_observed_at":"2026-07-06T22:51:31.209896Z","submitted_at":"2026-04-01T17:29:08Z","title":"Screening Is Enough","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T22:17:13.803778Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2604.01178"},"observation_digest":"sha256:1dd744046a8f725821c8a223f9a28d6169ebab27e2b2d80767e9e5a3eb22d540","observation_id":"8214c335-6e25-4887-94e1-bca7aca29e4e","resolution":{"observed_at":"2026-05-13T22:18:20.924558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2605.10045","last_updated":"2026-05-11T06:14:38Z","snapshot_observed_at":"2026-08-02T17:49:23.218899Z","submitted_at":"2026-05-11T06:14:38Z","title":"ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:01:32.762236Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2605.10045"},"observation_digest":"sha256:487ad129c07f76566de94127f023c8a886ab96319cc2b284fa6cb2ce45da65d6","observation_id":"7e276543-d219-40ab-870a-e97c1ee32e87","resolution":{"observed_at":"2026-05-12T07:26:28.046243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2605.10391","last_updated":"2026-05-11T11:36:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:36:37Z","title":"Phoenix-VL 1.5 Medium Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:27.144815Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2605.10391"},"observation_digest":"sha256:dc5dd3077a5ebc18016fd3b30dec59dae578921dd3fe5bbc71ccee4934063d8d","observation_id":"3a902776-13d8-420a-9934-45d5a0eca3c9","resolution":{"observed_at":"2026-05-12T06:01:24.890914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2605.12697","last_updated":"2026-05-12T19:48:36Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T19:48:36Z","title":"A Unified Framework for Critical Scaling of Inverse Temperature in Self-Attention","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-14T19:56:02.462786Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2605.12697"},"observation_digest":"sha256:92bbc66c07238bc7ddaa407849e2ae7b12fe5ea3a184bf41f66c93011e2a7394","observation_id":"87dc7db5-a504-499b-8cda-600fe95b4f51","resolution":{"observed_at":"2026-05-14T19:57:53.542250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2605.13986","last_updated":"2026-05-28T17:22:15Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T18:01:43Z","title":"TabPFN-3: Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T06:05:16.199413Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2605.13986"},"observation_digest":"sha256:a936657d1be9169f0a818196899790adb5ae05386e68d07b55b479a5497219be","observation_id":"059d601f-3e12-4ecd-b912-7690e1872ae0","resolution":{"observed_at":"2026-05-15T06:10:06.047420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2605.13986","last_updated":"2026-05-28T17:22:15Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T18:01:43Z","title":"TabPFN-3: Technical Report","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T21:37:08.627791Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2605.13986"},"observation_digest":"sha256:1fd564571485c7a3e2aa30742a99c69056da7e378a61f49b20f65272051f9f2a","observation_id":"45c62d5c-a0b1-49e2-907c-bd68b278b9b6","resolution":{"observed_at":"2026-07-01T14:25:46.516167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2605.20798","last_updated":"2026-05-20T06:43:34Z","snapshot_observed_at":"2026-08-02T17:01:43.729235Z","submitted_at":"2026-05-20T06:43:34Z","title":"Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-21T06:15:47.451870Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2605.20798"},"observation_digest":"sha256:3118b05c8be260250cbb529948bb6e5c2e5432e173360e693d4f1864994f23e9","observation_id":"48068909-0dd8-46d2-a385-e779d598b381","resolution":{"observed_at":"2026-05-21T06:19:42.039766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2606.25156","last_updated":"2026-06-28T22:03:33Z","snapshot_observed_at":"2026-08-06T21:38:57.687040Z","submitted_at":"2026-06-23T20:43:51Z","title":"ATMA: Length-Invariant Language Modeling via Polar Attention and Gated-Delta Compression Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:52.985532Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2606.25156"},"observation_digest":"sha256:0e03593f7cb4c119497dff286e4a5a306ebb7f09254ccb91cb7682ed895bd2ef","observation_id":"d54cc909-4148-41a9-af19-ec29a218b84a","resolution":{"observed_at":"2026-07-04T17:09:59.047893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2606.25156","last_updated":"2026-06-28T22:03:33Z","snapshot_observed_at":"2026-08-06T21:38:57.687040Z","submitted_at":"2026-06-23T20:43:51Z","title":"ATMA: Length-Invariant Language Modeling via Polar Attention and Gated-Delta Compression Memory","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T09:38:43.250420Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2606.25156"},"observation_digest":"sha256:2924cb70ac365e1ce3641e5dd820814087ced51934ce3df058056bca143ad6d7","observation_id":"5924af4a-ecc5-4c0c-a99f-4170508d4130","resolution":{"observed_at":"2026-06-30T09:44:37.730997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":"2501.19399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-07-04T17:09:59.046151Z","title":"Nakanishi , title =","venue":null,"work_id":"406e4802-3843-4bf8-979a-02f234877ad0","year":2025},"citing_paper":{"arxiv_id":"2607.01538","last_updated":"2026-07-01T23:38:25Z","snapshot_observed_at":"2026-08-02T05:27:20.501902Z","submitted_at":"2026-07-01T23:38:25Z","title":"Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T20:43:40.938898Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2607.01538"},"observation_digest":"sha256:4fb7f5cad1bff035665af0ce2ad737193bf5ba641efb01536cb2276a00408db4","observation_id":"91be52e2-032d-4042-a936-f8b56196e403","resolution":{"observed_at":"2026-07-03T20:48:55.216961Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.19399/citation-record","integrity":"/paper/2501.19399/integrity","json":"/paper/2501.19399/citation-record.json","paper":"/paper/2501.19399"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.134673Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.134673Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:79879c98d36d912a814fcb15422a9d10ce2444caaa7bf9a4028bc3761adf2867","observation_id":"2ed10e6f-91e7-4e9f-ae4b-3f33a355d427","resolution":{"observed_at":"2026-08-09T20:34:01.134673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.717474Z","title":"Etc: Encoding long and structured inputs in transformers","venue":null,"work_id":"9a159354-4ae0-470a-b14b-6e372beb8673","year":2020},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.140337Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:b47fd0f76770a9c527b14b6cdcea02a9b242af27e9c282c8c3566a56b2358fe3","observation_id":"4b958027-fc05-4726-83fd-f03e1142615a","resolution":{"observed_at":"2026-08-09T20:34:01.721755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.704828Z","title":"Needle in a haystack - pressure testing llms, 2023","venue":null,"work_id":"2b1367a0-0cbd-40f5-8e62-f6aa6701c033","year":2023},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.144584Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:47168b03b15bc4a1f5500d20fb27638e2862a4985db7a829e6710b6dd54695ef","observation_id":"ba82097c-5b3d-40ee-80d0-9979505729d3","resolution":{"observed_at":"2026-08-09T20:34:01.709283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-09T20:34:01.149151Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.149151Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:19637d0d7c217ca79d01ae962cbf4ed2138dd47becd5f24b1556759d45b7a9d3","observation_id":"92477d2e-ba56-47c1-9b9b-52b202cd2518","resolution":{"observed_at":"2026-08-09T20:34:01.149151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.693270Z","title":null,"venue":null,"work_id":"e16ab0fd-97f8-4246-80f3-69bf9ebac8b5","year":1901},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.155036Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:12f5fcf758803cb269fb31ae7b1d539e080ca2d26be3b621a80c282068fa0447","observation_id":"af892ac0-26ae-4e92-9a58-f6922ec37907","resolution":{"observed_at":"2026-08-09T20:34:01.696917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-09T20:34:01.160153Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.160153Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:980cc92498a857e895530a37fc8470e5c76148fd973acb1a2c24d7657acd8026","observation_id":"b27334a6-9fb7-4152-b4ed-c1dc68e81729","resolution":{"observed_at":"2026-08-09T20:34:01.160153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.679630Z","title":"Redpajama: An open source recipe to reproduce llama training dataset, April 2023","venue":null,"work_id":"58744a9e-4ad6-4073-b8e4-e5ef8f54ebc3","year":2023},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.165155Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:cb44f397c8b48ac39b189db61c7a68c825fdae695e484133858145af4def2428","observation_id":"e666f589-e24b-4c15-9bc4-2e326da9c711","resolution":{"observed_at":"2026-08-09T20:34:01.684935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03274","last_updated":"2020-06-05T07:50:40Z","snapshot_observed_at":"2026-08-10T05:56:18.040404Z","submitted_at":"2020-06-05T07:50:40Z","title":"GMAT: Global Memory Augmentation for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03274","snapshot_observed_at":"2026-08-09T20:34:01.170481Z","title":"and Berant, J","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.170481Z"},"links":{"cited_paper":"/paper/2006.03274","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:a4414b337cffc81a956f495e121c056c0cdd544d650680a795ceb04b6ed7e7c9","observation_id":"2e378df9-9919-4659-9baa-865950801315","resolution":{"observed_at":"2026-08-09T20:34:01.170481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.665830Z","title":"Needle in a haystack - pressure testing llms, 2023","venue":null,"work_id":"d77a643c-9e2e-400e-9c2d-7cb8433a19e9","year":2023},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.174657Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:c5b5f1abe21a5f4ad45377d3d404b2663a4dfdc9213f0e6c728c82ad3d97a8f5","observation_id":"5084afc2-b111-4f59-a5a8-6eeef06233c2","resolution":{"observed_at":"2026-08-09T20:34:01.670341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.651271Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":"bd894de5-82de-422b-866b-3f8b970ae4a6","year":2023},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.178471Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:36a813c0131cf2e064bf0c1a8e5e474acf7aef6f1fe760ebc2efdcb8e76e446e","observation_id":"55b2139c-c9c9-4bba-9c9d-e91538b5d273","resolution":{"observed_at":"2026-08-09T20:34:01.656333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-09T20:34:01.182826Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.182826Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:f5f20d6f61bba1c2a89fe7ddc200f823bc9c47a1e1a0e0e7323ff4c9807b2939","observation_id":"42a47d50-98d9-4644-ae9a-52cec5fac23c","resolution":{"observed_at":"2026-08-09T20:34:01.182826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.187475Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.187475Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:a291d52919d1bbc6a78cd50b6e7f704b1b66e5b0f22521f3c07bbcbb7c25c25d","observation_id":"dbe4dab1-c88c-4c3c-9d77-8444c61fdecd","resolution":{"observed_at":"2026-08-09T20:34:01.187475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-09T20:34:01.191643Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.191643Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:6b4238418d002f271b6d25eab0d8ec25b1be67896b936031097a8d5e77158e87","observation_id":"088bc4d1-82ce-41e8-9d7f-dff5b338909a","resolution":{"observed_at":"2026-08-09T20:34:01.191643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.627969Z","title":"Scaling laws of ro PE -based extrapolation","venue":null,"work_id":"becae7b4-fe5d-4567-8a7a-7e2589dec2fe","year":2024},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.196011Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:aeb867636dad1fa1774189a1c11bd0d2ee08264bca0c8c92a45b86fe5980c9e3","observation_id":"7fabc220-9369-4818-93e1-06316fc0aade","resolution":{"observed_at":"2026-08-09T20:34:01.632605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.615796Z","title":"and Hutter, F","venue":null,"work_id":"acb6e767-4e1a-4345-b3db-96d9fff9a832","year":2019},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.200339Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:e10cd8d2fa2fce4f7360945fde2a484137ebbda208167a906b42b37bea003d08","observation_id":"c0c7beda-2a5e-4b4d-8d56-43c9b9386cb7","resolution":{"observed_at":"2026-08-09T20:34:01.620244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-09T20:34:01.204290Z","title":"A., and Lewis, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.204290Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:34c1bd2ba77d7cbad4af5bd6d4cdb97194decb46a9462f9990916d2a9cfcf5cb","observation_id":"80e93c09-6eeb-4279-a265-fa4c0baf0979","resolution":{"observed_at":"2026-08-09T20:34:01.204290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.603743Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"6af06641-5010-4084-8072-1000037cd4bf","year":2019},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.208531Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:c438e0f076fe03db9a7d835728e6403b2ed6f1b6f4257676454e6b7fdf3624ee","observation_id":"c07752c3-592f-4efa-a1bc-8f42f540947f","resolution":{"observed_at":"2026-08-09T20:34:01.608076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.589565Z","title":"SQ u AD : 100,000+ questions for machine comprehension of text","venue":null,"work_id":"3640ba3f-d978-488a-b045-87bd38589114","year":2016},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.212024Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:d79b76abc08eac850847cc16d74b3b05ea42ed3423d05be67dcd37b84b783358","observation_id":"672dcff2-cfd2-4416-9f5c-87c364774549","resolution":{"observed_at":"2026-08-09T20:34:01.594186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.575116Z","title":"Know what you don't know: Unanswerable questions for SQ u AD","venue":null,"work_id":"1becba55-4f82-4fb4-a713-0209049a0b4d","year":2018},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.216919Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:1da88472c2b66cb8cb4b8040c88b92c0bf2e5111d51433b4ba63f2dfea79ee25","observation_id":"1a5ae387-fcab-438b-8b31-4ce5dcee1a3e","resolution":{"observed_at":"2026-08-09T20:34:01.580066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-09T20:34:01.220920Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.220920Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:81b1868e619ee920e1ba2b5bf613f44f224fe1e26e042e692d8991ea4a1bd8b2","observation_id":"ae3452d9-32d1-47c4-827d-ca61e191e457","resolution":{"observed_at":"2026-08-09T20:34:01.220920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.561623Z","title":"Efficient content-based sparse attention with routing transformers","venue":null,"work_id":"7a6e2c5d-b048-4f26-98b9-90cfbb8056eb","year":2021},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.225849Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:f2a385850aae9c10727765fdf8b0797da8d231e7984a60c9cd492e04eff9680c","observation_id":"03b547a5-d657-48d4-a3c3-832377568d2d","resolution":{"observed_at":"2026-08-09T20:34:01.565825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.546727Z","title":"Self-attention with relative position representations","venue":null,"work_id":"3f9bcb77-14a1-4bc0-8845-b06f54aa88d0","year":2018},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.229542Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:fdf650865f81b3ac36ceea0c73dc20707d0a4d5edb146c7d3ec67b3e6229c6ef","observation_id":"22a26b0f-8430-46a5-aed1-e915167855ad","resolution":{"observed_at":"2026-08-09T20:34:01.552563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-09T20:34:01.233103Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.233103Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:abe2bf937bc395cb25dcb22be1c894592558d346a926f43d05bd3ac5bc3f42b8","observation_id":"fc8e0108-2bb8-48fb-9c18-460b87a6c619","resolution":{"observed_at":"2026-08-09T20:34:01.233103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.532244Z","title":"R., Hestness, J., and Dey, N","venue":null,"work_id":"f408b88c-5c86-4bec-9c12-25e599e10aa4","year":2023},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.237096Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:0fc14ad0d10f26e60532f1823c93e5436ba697d925e39ec6da5c31bc03ec6707","observation_id":"af07bdd1-1197-44fe-b133-9f926d5b3124","resolution":{"observed_at":"2026-08-09T20:34:01.537092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.240997Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.240997Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:1dcb67a715744e383461f0c45c0327221b237e4b63f660ebab185764f98aba2e","observation_id":"7896d758-26e6-412c-820a-1a804a63671a","resolution":{"observed_at":"2026-08-09T20:34:01.240997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.510256Z","title":"Adaptive attention span in transformers","venue":null,"work_id":"ef2f5159-a3f6-43a4-9151-554287b4e789","year":2019},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.244520Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:0c86e5d97ae3e279aa16b0d8873ec305a1259a2a2f9ace203703bd214838516c","observation_id":"f87f8846-8bc2-4896-8e5a-4a95b40b0be6","resolution":{"observed_at":"2026-08-09T20:34:01.515253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T20:34:01.249086Z","title":"R., Albert, P., Almahairi, A., Babaei, Y., Bashlykov, N., Batra, S., Bhargava, P., Bhosale, S., Bikel, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.249086Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:3e72d10ce5ac5e77e11c9e4edf418dd86cef34cc90ee1254aa05ad8e893d70fe","observation_id":"e7d417f5-166c-4484-b821-73942fafef59","resolution":{"observed_at":"2026-08-09T20:34:01.249086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.498581Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":"b2ed5011-bc37-4d04-9f81-ef3cabbc33fa","year":2017},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.253366Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:9847b1d7d331fac5edc1342c1939d6badf1a26f3f87aa68f92934e2c3b36f257","observation_id":"d767d1a9-4b1d-47ec-9edc-964290771642","resolution":{"observed_at":"2026-08-09T20:34:01.502711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12224","last_updated":"2024-05-28T01:38:59Z","snapshot_observed_at":"2026-07-06T18:02:15.186390Z","submitted_at":"2024-04-18T14:38:32Z","title":"Length Generalization of Causal Transformers without Position Encoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12224","snapshot_observed_at":"2026-08-09T20:34:01.257094Z","title":"Length generalization of causal transformers without position encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.257094Z"},"links":{"cited_paper":"/paper/2404.12224","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:184a2f41fc5104ba12bfce6861092cd601c20738be17336e834653d8bfa8df21","observation_id":"c72e8e0f-57f3-4f34-b4ce-a6db9d23ebcd","resolution":{"observed_at":"2026-08-09T20:34:01.257094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.486295Z","title":"V., and Zhou, D","venue":null,"work_id":"4d305d44-0976-4317-98cc-9903e03ede54","year":2022},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.261120Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:b3b93fe06b2aabc31c173e365073163d2b428a78197c8d00bfd0b8a278c79db4","observation_id":"8bbe99af-eec7-405e-b837-61811ca41f61","resolution":{"observed_at":"2026-08-09T20:34:01.490700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05258","last_updated":"2025-04-07T12:04:28Z","snapshot_observed_at":"2026-08-03T16:01:59.392774Z","submitted_at":"2024-10-07T17:57:38Z","title":"Differential Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05258","snapshot_observed_at":"2026-08-09T20:34:01.265036Z","title":"Differential transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.265036Z"},"links":{"cited_paper":"/paper/2410.05258","citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:ef2bbe5fec35e469e33d1a8f10f448be5b04e6e8ad517223487c49c0ba411ec6","observation_id":"7cb6b1d2-436f-4fab-b038-103e2a046339","resolution":{"observed_at":"2026-08-09T20:34:01.265036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.466103Z","title":"A., Ainslie, J., Alberti, C., Ontanon, S., Pham, P., Ravula, A., Wang, Q., Yang, L., and Ahmed, A","venue":null,"work_id":"e6267d37-371f-48e5-9ea5-c23d06cb5c98","year":2020},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.269080Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:6272d6e56e80382e0c319627480c7749a19c6515b669856ed12384f13258f2d7","observation_id":"451730d9-5fce-48c8-bec8-057ca56429ac","resolution":{"observed_at":"2026-08-09T20:34:01.473502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.273009Z","title":"and Sennrich, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.273009Z"},"links":{"citing_paper":"/paper/2501.19399"},"observation_digest":"sha256:bf091b20bdedb3e797bbd21cc7fc97d046334be61f1eac9bbe31381be01c4b95","observation_id":"8e252d1a-4a8f-4e76-9075-1c1ec35fb147","resolution":{"observed_at":"2026-08-09T20:34:01.273009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T03:49:47.213210Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 16 inbound Pith citation observations for arXiv:2501.19399."}