{"as_of":"2026-08-09T22:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8807fb85470db60654ddb7c8a92df417864790c699dbeadb61266bd183d92961","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:56.038504Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:59.474337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:21:02.595394Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14840","snapshot_observed_at":"2026-08-07T15:10:59.474337Z","title":"Sub- quadratic algorithms and hardness for attention with any te mperature","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16284","last_updated":"2025-05-22T06:26:28Z","snapshot_observed_at":"2026-08-07T22:03:10.571335Z","submitted_at":"2025-05-22T06:26:28Z","title":"Only Large Weights (And Not Skip Connections) Can Prevent the Perils of Rank Collapse","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:59.474337Z"},"links":{"cited_paper":"/paper/2505.14840","citing_paper":"/paper/2505.16284"},"observation_digest":"sha256:c6c711b903586daa30b681c2070d7b82fed14f0d8a849eeaef034f2b999fa35a","observation_id":"e89f4b95-e4dd-4266-b404-8d946c58019e","resolution":{"observed_at":"2026-08-07T15:10:59.474337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"cited_work":{"arxiv_id":"2505.14840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14840","snapshot_observed_at":"2026-08-07T14:21:02.595394Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","venue":"cs.LG","work_id":"adfeef27-5a91-446a-b0f8-9874a6f023f4","year":2025},"citing_paper":{"arxiv_id":"2505.19531","last_updated":"2025-05-26T05:33:26Z","snapshot_observed_at":"2026-08-08T07:05:10.715675Z","submitted_at":"2025-05-26T05:33:26Z","title":"Minimalist Softmax Attention Provably Learns Constrained Boolean Functions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:00.874738Z"},"links":{"cited_paper":"/paper/2505.14840","citing_paper":"/paper/2505.19531"},"observation_digest":"sha256:508c1b01a705fb11e951f485c40bf8099e0b98877b11828cb898e1c2b8d5e0ce","observation_id":"063b1293-4e99-4560-8953-4c1d2dd07be4","resolution":{"observed_at":"2026-08-07T14:21:02.673064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14840/citation-record","integrity":"/paper/2505.14840/integrity","json":"/paper/2505.14840/citation-record.json","paper":"/paper/2505.14840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.170821Z","title":"Optimal-degree polynomial approximations for exponentials and gaussian kernel density estimation","venue":null,"work_id":"2b31ee8a-cae4-4772-a792-93570705d213","year":2022},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.212020Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b5e20d878a8b4e969ea26600b3fd4ade09cf0bb50f5e0f55294d01f777060524","observation_id":"cf9be8d4-929c-47ea-805f-5b2c3def07fb","resolution":{"observed_at":"2026-08-07T15:43:06.294252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.749804Z","title":"More asymmetry yields faster matrix multiplication","venue":null,"work_id":"7d3ef979-9a50-4e9d-a35b-d06b038f4c15","year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.263469Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:66817e9697549b8f361c6902d63332fde011de3eb315c2c39f82360f7969c396","observation_id":"eccc12aa-db0c-4c9f-a835-8fbd3ca266d5","resolution":{"observed_at":"2026-08-07T15:43:05.992417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.527324Z","title":"Agarwal, Herbert Edelsbrunner, Otfried Schwarzkopf, and Emo Welzl","venue":null,"work_id":"ed70a1fb-ea44-471a-a5de-b7b05ee00340","year":1991},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.396561Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:512a8c166500842f7fe5012ac6d2be37ecc8d24df6bf9e993393d3380dbc57ab","observation_id":"007036b9-dab1-4023-9d41-6dfc7128b05b","resolution":{"observed_at":"2026-08-07T15:43:05.607992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.233256Z","title":"Finer-grained hardness of kernel density estimation","venue":null,"work_id":"29a40545-13ad-408e-aeb7-58a42bebf846","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.451427Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:7d3a282f01d5e41bc77c29577cda5fbf3ab71c1718c9e3accbc8b454250b3b60","observation_id":"d27eb968-079b-41eb-bcfd-ecab3f0e7b28","resolution":{"observed_at":"2026-08-07T15:43:05.376900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.972255Z","title":"Fast attention requires bounded entries","venue":null,"work_id":"9be86d46-d59e-4249-ad04-e26a19a706c3","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.566594Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:cde01299892d34bc64259a25bc9424bd43fc96217293c98fe7415da12ddaf476","observation_id":"63f53770-77d3-45d4-b035-19fa442e27e1","resolution":{"observed_at":"2026-08-07T15:43:05.080898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04497","last_updated":"2024-02-07T00:45:31Z","snapshot_observed_at":"2026-08-09T22:39:59.118786Z","submitted_at":"2024-02-07T00:45:31Z","title":"The Fine-Grained Complexity of Gradient Computation for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04497","snapshot_observed_at":"2026-08-07T15:42:50.649122Z","title":"The fine-grained complexity of gradient computation for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.649122Z"},"links":{"cited_paper":"/paper/2402.04497","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:630b4307a0dbff8c84f6e97e3ab6ba51b14bdab21bc6a2181fed5ff4f037ab9e","observation_id":"636e0c95-4aee-498a-ae0c-ceeb56d11482","resolution":{"observed_at":"2026-08-07T15:42:50.649122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.769749Z","title":null,"venue":null,"work_id":"8c68267e-b8ce-4dec-a467-fa4e996f7c9a","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.702972Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:7902340f0f91bd513e25006b3d51bdfcb32e4606e659d77242ee21abc61caf70","observation_id":"94a91b4a-c14f-4165-ba9f-06ec29bbc24c","resolution":{"observed_at":"2026-08-07T15:43:04.876681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.529464Z","title":"More applications of the polynomial method to algorithm design","venue":null,"work_id":"5866ed8d-2bae-46bb-9229-a4df30b33d87","year":2015},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.795404Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:bfd71807c2243eeb1db5100a86922b197d44391fc2236f13f46d05cde0262c48","observation_id":"85f6b080-20cf-4383-aace-4f2a271e4fcf","resolution":{"observed_at":"2026-08-07T15:43:04.606870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.345270Z","title":"More applications of the polynomial method to algorithm design","venue":null,"work_id":"55113d7c-079c-48ca-b48c-b004335b0a60","year":2015},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:50.947012Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:2a765c794c3c45c7035339e825b0be515cfe10f9003050c174c16a0a327bb25c","observation_id":"9e1b531c-d10c-4f9e-af6e-2f33da3e05c2","resolution":{"observed_at":"2026-08-07T15:43:04.426903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:51.050607Z","title":"Fundamental limitations on subquadratic alternatives to transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.050607Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:a3fb89e79eddbac1185e2838c25cc25533b674013aaa00449ed36d2be16a47dc","observation_id":"4fdf8855-638b-4b31-993c-ff75e112c908","resolution":{"observed_at":"2026-08-07T15:42:51.050607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.215613Z","title":"Edit distance cannot be computed in strongly subquadratic time (unless SETH is false)","venue":null,"work_id":"b05b5a65-865c-456d-a21b-5a05feed7e34","year":2018},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.145448Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:0e58ac21fc8a0475e4f70641dc37a192425e3044656246dcdee7db94f42e610d","observation_id":"3c46e104-686a-4983-8536-697d30f67d93","resolution":{"observed_at":"2026-08-07T15:43:04.257153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.965431Z","title":null,"venue":null,"work_id":"01f3940f-daef-49e7-856a-eee1ddd0dbe9","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.220065Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:8b885de5918a8abde15a6185598c1416094b1207e4b5487f42874f5db39b3663","observation_id":"fa974cf9-92d3-4d27-a240-3dc36b6c16ec","resolution":{"observed_at":"2026-08-07T15:43:04.090036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02207","last_updated":"2023-04-05T03:43:38Z","snapshot_observed_at":"2026-08-05T13:33:02.149756Z","submitted_at":"2023-04-05T03:43:38Z","title":"Algorithm and Hardness for Dynamic Attention Maintenance in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02207","snapshot_observed_at":"2026-08-07T15:42:51.308081Z","title":"Algorithm and hardness for dynamic attention maintenance in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.308081Z"},"links":{"cited_paper":"/paper/2304.02207","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:287b42f3162b213f3b88fb666d5e58ee06ce8b94c96a1ffd057ba8aa4b4f841e","observation_id":"0b4b1022-fedd-4ef0-99b3-892349274850","resolution":{"observed_at":"2026-08-07T15:42:51.308081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.809217Z","title":"Scatterbrain: Unifying sparse and low-rank attention","venue":null,"work_id":"2f0426cd-9915-41b7-acb0-0ea48d8d6c75","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.424750Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:a5714a68140a61025433ae3ce45e9d0b9d6df23953020cdda67607a2f45672e4","observation_id":"420a362f-9cb1-4d1a-bd2b-56333775d765","resolution":{"observed_at":"2026-08-07T15:43:03.904261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.521886Z","title":"On the hardness of approximate and exact (bichromatic) maximum inner product","venue":null,"work_id":"e1c90140-6938-4e5d-9250-c88750d16571","year":2018},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.530306Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:646a6385c6e839ceb291b3623e7cf19e6c93e28edfa8da7dee2760f2809139f9","observation_id":"71d2839d-0e94-4490-bb2e-e77f49194bb9","resolution":{"observed_at":"2026-08-07T15:43:03.689280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.353635Z","title":null,"venue":null,"work_id":"817b9339-4874-457a-8c5c-4c0d099869e8","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.697517Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:481822bd0b17938255625a3caec134a15e1b38b1d5955be3dbf1c8c467beea50","observation_id":"7f6106ef-69b8-4f42-84dd-eef3a90edc99","resolution":{"observed_at":"2026-08-07T15:43:03.453510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.136415Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":"30f56386-7a1f-4aa5-b9df-10dfca54fcb7","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.806676Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:621f828952796c2e80f7908a38a914dd9fb20f711803ed94121527a056fc28f4","observation_id":"4ead6a3c-60a7-464e-8b30-b6ab0957472e","resolution":{"observed_at":"2026-08-07T15:43:03.211547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.935541Z","title":"Chan and Ryan Williams","venue":null,"work_id":"ae7b0822-c307-4635-aac0-85d4587b999e","year":2016},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:51.920588Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b6f21a67f34c69c945bd904615a8ea4d7953c5d79761632ec53e54d92458f07c","observation_id":"be6b873c-b514-4a07-822b-06eefd18f82e","resolution":{"observed_at":"2026-08-07T15:43:03.054742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.712909Z","title":"Approximation algorithms for min-distance problems in dags","venue":null,"work_id":"7e68ea43-2efa-4818-b354-859bd252ced1","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.078585Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:d9c413b84eace1f82ef9b1800ce094b7fd6643a47a22058f02d7d79c2cbd3a95","observation_id":"b28b81d7-f8dd-4166-96a4-f4bdbcecfbd9","resolution":{"observed_at":"2026-08-07T15:43:02.814751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07418","last_updated":"2023-09-14T04:23:40Z","snapshot_observed_at":"2026-07-06T16:18:17.458740Z","submitted_at":"2023-09-14T04:23:40Z","title":"A Fast Optimization View: Reformulating Single Layer Attention in LLM Based on Tensor and SVM Trick, and Solving It in Matrix Multiplication Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07418","snapshot_observed_at":"2026-08-07T15:42:52.220796Z","title":"A fast optimization view: Reformulating single layer attention in llm based on tensor and svm trick, and solving it in matrix multiplication time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.220796Z"},"links":{"cited_paper":"/paper/2309.07418","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:2dc22dd68ee814de23bdfc7e4b4714c3b069686defc2dfe3347e0fd3d94f8ece","observation_id":"477ac53f-f88c-4aa6-ab43-da5744a65aa8","resolution":{"observed_at":"2026-08-07T15:42:52.220796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.325301Z","title":"Fast quantum algorithm for attention computation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.325301Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:d8db70e18525f1c32ab1be0a46b2821a2ee29ac52b84ea54fabd357504cdd057","observation_id":"8217d114-3f3d-492a-82a0-c0f4bc1a114b","resolution":{"observed_at":"2026-08-07T15:42:52.325301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04701","last_updated":"2024-10-14T15:52:31Z","snapshot_observed_at":"2026-08-07T14:28:09.592784Z","submitted_at":"2023-05-08T13:32:41Z","title":"Differentially Private Attention Computation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04701","snapshot_observed_at":"2026-08-07T15:42:52.462000Z","title":"Differentially private attention computation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.462000Z"},"links":{"cited_paper":"/paper/2305.04701","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b8db02501cccf0ac31a292ba9fea8adc3808a707df3db7489a19dcab3330c139","observation_id":"799a7b38-a586-4eeb-b831-df2531f5fef1","resolution":{"observed_at":"2026-08-07T15:42:52.462000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.585794Z","title":"Hyperattention: Long-context attention in near-linear time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.585794Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:4b30ae71fc3f323249f022aa0471a2fbc043336fd4df628cc9820a6a92d25207","observation_id":"12f3d788-0006-4ce1-965a-49a7a0f3a83f","resolution":{"observed_at":"2026-08-07T15:42:52.585794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.408490Z","title":"Singular value decomposition (svd)","venue":null,"work_id":"f066107d-f7e4-4922-908a-5bc8f9cbd484","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.686450Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:f324fa0b34d349bf05bb287930a7a572209f9e138c06ada12bb99566b7367b8b","observation_id":"c5a46af3-c0b8-46df-9430-68a207c9b6b8","resolution":{"observed_at":"2026-08-07T15:43:02.532270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.164097Z","title":"Adco: Adversarial contrast for efficient learning of unsupervised representations from self-trained negative adversaries","venue":null,"work_id":"edbe2bf7-4db3-4704-9274-66055a4f3996","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:52.896302Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:ca6a9d93e7f3765867b6e43f29ce451edf2a1175f95e18e4534cda4b04c1eeac","observation_id":"f33c69ca-bbbc-4449-88b3-0cc493bd2fc1","resolution":{"observed_at":"2026-08-07T15:43:02.254890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.035468Z","title":"On the complexity of k-sat","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.035468Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:80f4492c2d065045b1f3d1494b6ca99a8bb27824fe71a779464ac537df70f330","observation_id":"96368467-d70c-4dca-ae4e-bc96ba646f6b","resolution":{"observed_at":"2026-08-07T15:42:53.035468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.901733Z","title":"Dynamic temperature scaling in contrastive self-supervised learning for sensor-based human activity recognition","venue":null,"work_id":"edcfbc44-3f30-478d-a09c-8099194906fb","year":2022},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.137958Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b9589a3dd8d9b405111183a977f15f18e4f3d9426d09a4a61ef756ba4c3b4e69","observation_id":"f1a1b9e0-a91d-42a1-8389-6650a5f42e80","resolution":{"observed_at":"2026-08-07T15:43:02.027581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.671544Z","title":"Temperature schedules for self-supervised contrastive methods on long-tail data","venue":null,"work_id":"9f9ef3da-730e-4d0b-877c-6b2141725560","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.247265Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:3991484a38a5fc04de777c565e7af428f21cc42ce0586f520ef2645bc8dcb7fe","observation_id":"4bdda98e-8538-444b-af14-dfdacc69668d","resolution":{"observed_at":"2026-08-07T15:43:01.785805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.437273Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"c1ee6a80-6f64-4c70-8277-67cb04397e89","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.336694Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:49629516d4cda8bae3640bd3e3eebe6d93671cb5f3b727924b83e1353bab73c8","observation_id":"aebff8fb-1c35-4dd1-a2fc-0b7d5e984509","resolution":{"observed_at":"2026-08-07T15:43:01.544849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.197679Z","title":"Polysketchformer: Fast transformers via sketching polynomial kernels","venue":null,"work_id":"033f3ee3-d619-43db-a671-8b1ee20ca3c9","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.464406Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:cae18d5b3b25f1ad08eb36adc50c10e2f91c20d89a559ea5be5947c5d41177a4","observation_id":"c6017b96-d216-4211-a165-0b5c5ed760b5","resolution":{"observed_at":"2026-08-07T15:43:01.286407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.966049Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"5a0b0ffc-ac19-4503-94c8-9cf6d0dc3938","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.547454Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:d4708f219c01e162b548bd5e67bc0868cfef35acf47e3a778303fd17e6d2775e","observation_id":"ac6abbbd-40e5-4ae4-a7a2-464ba15f3ba9","resolution":{"observed_at":"2026-08-07T15:43:01.075432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.810808Z","title":"On the computational complexity of self-attention","venue":null,"work_id":"e9edd15d-becf-464e-8be1-3e0b0cebda0a","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.641191Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:31cd25cff46f54144ec3456983faeac46bc5f8991a30779c26355a9bb36e10a5","observation_id":"1ba79cb2-c871-4351-aff7-15d22112c230","resolution":{"observed_at":"2026-08-07T15:43:00.876464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.611757Z","title":"Efficient partition trees","venue":null,"work_id":"428ef31b-eb7e-4d12-ba46-c15e29a5174a","year":1992},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.726812Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:20ce4e000edef559c46f9a4933c550aa87882192dbb104fd538b2fa16a81576c","observation_id":"86ef437b-7541-4a68-be29-d5eb9070577f","resolution":{"observed_at":"2026-08-07T15:43:00.721005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01140","last_updated":"2024-05-10T17:26:36Z","snapshot_observed_at":"2026-08-09T20:32:58.514447Z","submitted_at":"2023-08-02T13:31:41Z","title":"Dynamically Scaled Temperature in Self-Supervised Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01140","snapshot_observed_at":"2026-08-07T15:42:53.905463Z","title":"Dystress: Dynamically scaled temperature in self-supervised contrastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:53.905463Z"},"links":{"cited_paper":"/paper/2308.01140","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:af16deb132b425c85c9f6265973b3d3b0738e415a328b154d7cf446910e690e1","observation_id":"e6c2f0df-64b6-414c-851c-0423c5980030","resolution":{"observed_at":"2026-08-07T15:42:53.905463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.453959Z","title":"Fine-tuning language models with just forward passes","venue":null,"work_id":"f703b4f5-395f-4cea-97e4-f73308ddfe17","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.032189Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:6dbe217679baf421ab44cacbbf94e6eb076c897eadcc23b3eea25d3bcf21d102","observation_id":"4f3c905d-e20d-4b32-b973-baad50c3aaa3","resolution":{"observed_at":"2026-08-07T15:43:00.503433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.182869Z","title":"Trainable transformer in transformer","venue":null,"work_id":"c2970449-f46e-45b7-b754-3997c58fca2c","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.101261Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:a7a51ff900482cccf62631c6175220f3d8e407f53178beccab35bd605ef9be11","observation_id":"160bfaa0-32b6-4a06-8a8e-93ef69ccae94","resolution":{"observed_at":"2026-08-07T15:43:00.379862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.936946Z","title":"Can contrastive learning avoid shortcut solutions? In Advances in Neural Information Processing Systems NeurIPS 34 , 2021","venue":null,"work_id":"1c40aa20-c150-46aa-b5f5-9f919448361e","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.217960Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:f38d35e30deb907e1064ad337f5c35236ea7b24b7511bf56e31147bb751a3e0b","observation_id":"8e633a9c-3926-4abd-931c-6eab39c045a7","resolution":{"observed_at":"2026-08-07T15:43:00.044207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.729979Z","title":"The singular value decomposition (svd) and low-rank matrix approximations","venue":null,"work_id":"cc0e9897-c387-4e8c-a3af-c8aa91700414","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.325768Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:cde2bcd3e7aec5e3d4ef8973b09c3c95b93c8201eaecdc01ed65a55a582a1508","observation_id":"ad99f3c8-3d9d-4cfa-ab88-6322479b0cad","resolution":{"observed_at":"2026-08-07T15:42:59.800394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.507659Z","title":"Fast approximation algorithms for the diameter and radius of sparse graphs","venue":null,"work_id":"b65a29c6-66db-4d82-8c78-d85aaf7836e3","year":2013},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.408501Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:ea5b9001d61bed0bd21578eb2dd6f75e0832747bd129e8c375ba7fa5bb117114","observation_id":"8eb03f50-1dfd-488e-b2bb-85b5af44c0ba","resolution":{"observed_at":"2026-08-07T15:42:59.622423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.186084Z","title":"Understanding transformer reasoning capabilities via graph algorithms","venue":null,"work_id":"42b3d0b4-a97c-4781-b7cc-a38fdd329fd3","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.529794Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:937f376fe120b29d96e084d92722a10597a0ba3a347e84e30f2a28a2d25bd161","observation_id":"d8d15c9d-a049-4b43-a4a0-a590fd699371","resolution":{"observed_at":"2026-08-07T15:42:59.366698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.843923Z","title":"Hsu, and Matus Telgarsky","venue":null,"work_id":"39fdd74d-ea57-4c9a-8811-f004e4ae401a","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.668131Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:096b93c32c73850d00161bc1d5579c95db027d1f43971bbce78008b33079feb3","observation_id":"1e9b2544-6d54-492a-96c9-5de3a69add48","resolution":{"observed_at":"2026-08-07T15:42:58.990886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.637437Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":"b2eef43f-25c1-4007-b012-33f6e315460c","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.740302Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:e781d0ae7be9092a8ed139d095557b0f5cd13ce24494e7c5917d1a2ab676e0cd","observation_id":"228b1592-be39-4cbe-a5a5-6018d1630d40","resolution":{"observed_at":"2026-08-07T15:42:58.730020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.360236Z","title":"I / O complexity of attention, or how optimal is F lash A ttention? In Proceedings of the 41st International Conference on Machine Learning , 2024","venue":null,"work_id":"c75d4f3e-1b88-48ea-8469-f5b9349c1332","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.836435Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:fc92f816cb7103255829971e2f6dcb32ba669ba36663373727d319555529440f","observation_id":"54cbe930-4419-42da-8403-23df6ae03bf4","resolution":{"observed_at":"2026-08-07T15:42:58.506938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.017735Z","title":"Solving attention kernel regression problem via pre-conditioner","venue":null,"work_id":"0d9713d2-ff6c-4784-af8b-4bcd8c2fae2f","year":2024},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:54.937026Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b047e59a29df6799c1ccc7ef0dcfd92b8b0bc720a49bc61ae3e477bf1d87ee07","observation_id":"4417aab9-c5d8-40a0-93e0-a8b6a684cb36","resolution":{"observed_at":"2026-08-07T15:42:58.106015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.726334Z","title":"All pairs shortest paths in undirected graphs with integer weights","venue":null,"work_id":"5f03831b-7fa6-438e-a660-7272774622be","year":1999},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.049039Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:ca74053b7777d7099005cdafef0ddc2febf4df28b5f2fab08bc6438010743d60","observation_id":"96a1a9e8-9f30-4ab7-a05a-02346c063cbc","resolution":{"observed_at":"2026-08-07T15:42:57.846921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.479523Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"4f85fe8d-4d5b-4c9f-9bf0-20db575abd7e","year":2017},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.118698Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:449c439dd4a70969a279e6e77ebc7dabf0c6b6a9d98caf506062100057e5e1a2","observation_id":"fa768160-b9b3-4b0c-8c0d-ad5a47d6e672","resolution":{"observed_at":"2026-08-07T15:42:57.635726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.227309Z","title":"Understanding contrastive representation learning through alignment and uniformity on the hypersphere","venue":null,"work_id":"f326a563-a196-4118-81c2-ded2dde0de5e","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.252685Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:1985183ce8adb34aaa01011a06a91d95f3992564bb6bd24355f26149df26b155","observation_id":"3cb3c2a5-da3a-44a7-b740-a6787bee2fb0","resolution":{"observed_at":"2026-08-07T15:42:57.346080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.967655Z","title":"A new algorithm for optimal constraint satisfaction and its implications","venue":null,"work_id":"d5332f02-2fce-4a77-a53e-942b19510ef3","year":2004},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.424063Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:405527b92e1c7c7ddecf2315e4c98f98c3ec896e4efafc0d2c61e6838c08eec2","observation_id":"d18e179c-ad43-426c-b11e-2ba09960552f","resolution":{"observed_at":"2026-08-07T15:42:57.054364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.862731Z","title":"Ryan Williams","venue":null,"work_id":"7699da1b-0988-40d0-8d52-d43709facf45","year":2018},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.543446Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:42305076f28baafe5356cd831e1dca142a609b323157890cc519649582dff4d4","observation_id":"8f264577-561f-4f79-9797-4b50ff79d5cf","resolution":{"observed_at":"2026-08-07T15:42:56.936522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.706244Z","title":"Understanding the behaviour of contrastive loss","venue":null,"work_id":"4f6fcf0d-2617-4cb3-a3fd-59b7d845e12c","year":2021},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.641313Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:1371c2d96a82176c4c8fa05c72776190758d77edd7cc51f57df35ae54ec3c9ab","observation_id":"2cecae4b-471b-40ee-91c0-f978a17b8cfb","resolution":{"observed_at":"2026-08-07T15:42:56.763351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20604","last_updated":"2025-02-28T00:07:45Z","snapshot_observed_at":"2026-08-07T17:41:22.955809Z","submitted_at":"2025-02-28T00:07:45Z","title":"Exploring the Impact of Temperature Scaling in Softmax for Classification and Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20604","snapshot_observed_at":"2026-08-07T15:42:55.696237Z","title":"Exploring the impact of temperature scaling in softmax for classification and adversarial robustness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.696237Z"},"links":{"cited_paper":"/paper/2502.20604","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:bbf15b0930ba5f2e559fdbed19b77c95128998bd2decac3857c34071d7b302c6","observation_id":"f1fe6883-1b81-48c4-80e0-712940b5de1e","resolution":{"observed_at":"2026-08-07T15:42:55.696237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.584446Z","title":"On constructing minimum spanning trees in k-dimensional spaces and related problems","venue":null,"work_id":"36659861-fc21-4444-98d3-bdb711b44048","year":1982},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.771449Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:2c7e11c2ccdcf919df75a9bb5ffa871f0eb80a13b72a5c3df2a1b423211b9282","observation_id":"e681278f-1bcd-435e-a8bb-e59bc83e1b75","resolution":{"observed_at":"2026-08-07T15:42:56.647695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01805","last_updated":"2026-06-17T11:42:47Z","snapshot_observed_at":"2026-08-07T17:32:44.612536Z","submitted_at":"2025-03-03T18:33:58Z","title":"Depth-Width tradeoffs in Algorithmic Reasoning of Graph Tasks with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01805","snapshot_observed_at":"2026-08-07T15:42:55.833385Z","title":"Depth-width tradeoffs in algorithmic reasoning of graph tasks with transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.833385Z"},"links":{"cited_paper":"/paper/2503.01805","citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:b6cd139fc89d366b6b23f0c170aa6ff435a39f9deaadaf5cdedeb83c410864c0","observation_id":"9eab0b74-f8f8-4aa0-8d99-4d97292a4159","resolution":{"observed_at":"2026-08-07T15:42:55.833385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.446359Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"2f5dc47f-ddb9-4317-b541-7bdc158bf6ae","year":2020},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.913849Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:99e3a669167eb4f6635aa7a1e00b2b33b2012f2448a3828020c17e9771e268ac","observation_id":"8b4b64dc-4ecf-4041-bb73-bdaa610e13af","resolution":{"observed_at":"2026-08-07T15:42:56.507359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.313561Z","title":"Kdeformer: Accelerating transformers via kernel density estimation","venue":null,"work_id":"7d69e849-c548-4a0e-a5e0-8552c3ecd38f","year":2023},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:55.976518Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:d4257525d713ca587c17424d7d78f56770996112869ec33014806a0e99955b53","observation_id":"3accb36a-a310-4010-88b2-ca9386b7f40f","resolution":{"observed_at":"2026-08-07T15:42:56.363767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.038504Z","title":"All pairs shortest paths using bridging sets and rectangular matrix multiplication","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:56.038504Z"},"links":{"citing_paper":"/paper/2505.14840"},"observation_digest":"sha256:6a353aed68c53e1f715a084a5549ab4cfa9a54c1900330c8ac5eb809c741172a","observation_id":"0ee2aab9-5aac-4e8b-b1e9-5acf4eee16eb","resolution":{"observed_at":"2026-08-07T15:42:56.038504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14840","last_updated":"2025-05-20T19:12:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:27:21.465455Z","submitted_at":"2025-05-20T19:12:43Z","title":"Subquadratic Algorithms and Hardness for Attention with Any Temperature"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2505.14840."}