{"as_of":"2026-08-12T21:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8b078bb1b34378e1502bbd2aba222532e41b834871ccfcfb019c58d52643097","coverage":[{"denominator":107,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:28:30.235477Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:01:50.784615Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T05:01:51.549105Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"cited_work":{"arxiv_id":"2411.10741","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10741","snapshot_observed_at":"2026-08-11T05:01:51.549105Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","venue":"cs.LG","work_id":"bf052e7b-baa6-4783-a981-1558e6c5aa45","year":2024},"citing_paper":{"arxiv_id":"2412.18178","last_updated":"2024-12-25T06:33:25Z","snapshot_observed_at":"2026-08-12T08:01:52.356150Z","submitted_at":"2024-12-24T05:27:11Z","title":"VisionGRU: A Linear-Complexity RNN Model for Efficient Image Analysis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:50.784615Z"},"links":{"cited_paper":"/paper/2411.10741","citing_paper":"/paper/2412.18178"},"observation_digest":"sha256:999812e52bb34fbe36d126c93fbe2a786f33792b9956525260a54c127f999cc6","observation_id":"eeeb9e82-af74-43df-a15d-25f3b9ee0a81","resolution":{"observed_at":"2026-08-11T05:01:51.556459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10741/citation-record","integrity":"/paper/2411.10741/integrity","json":"/paper/2411.10741/citation-record.json","paper":"/paper/2411.10741"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.510704Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.510704Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:460ae656e9284dd20c31e5d63f4a8fa1257c6c5162e325714a575850717dea7e","observation_id":"ca9ffb97-f30e-4a4a-ab97-0253f5b863e9","resolution":{"observed_at":"2026-08-12T19:28:28.510704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.551687Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.551687Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:d5bd61a296028e169e056ba648f4f5f4bc16dd165ddd7f33e137f616f69f33b9","observation_id":"bcf7d755-9740-4653-9bfd-e574d4f24634","resolution":{"observed_at":"2026-08-12T19:28:28.551687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T19:28:28.558921Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.558921Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:ce80b0720a7264ed3a2c9dbc19f41297d04c8b1d0d15a0ef197ccd2b6de8bf9e","observation_id":"3fec83d1-e2c6-4321-8cd4-0219d1992880","resolution":{"observed_at":"2026-08-12T19:28:28.558921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T19:28:28.567101Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.567101Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:739e71188c4f540f53167d0cb4fd604733eecfbf72721277f1a0d7e889e76a71","observation_id":"f304b7d7-e324-49c7-a2fb-d7cdea813434","resolution":{"observed_at":"2026-08-12T19:28:28.567101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-12T19:28:28.573451Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.573451Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:668dfc10a7d6405edebc91ef20408173c8369f0c4164bf9229b72fbaf9c99aad","observation_id":"411c35a1-b9f4-4ffd-8ddf-6b444874f751","resolution":{"observed_at":"2026-08-12T19:28:28.573451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-12T19:28:28.579010Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.579010Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:7d2a88e3450b15cdd19c73fb73916c3e7ab0b62a22389c5d664f13063e2961a9","observation_id":"0f1cf6f9-d5c9-4f9d-b402-cbed9da12c3c","resolution":{"observed_at":"2026-08-12T19:28:28.579010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.585803Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.585803Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:87d5200b9f4fccaf0c0e78a070a174f8afc7e718e25297090bc6287752adac84","observation_id":"81a79af0-9881-4332-a8ef-2afa57beffba","resolution":{"observed_at":"2026-08-12T19:28:28.585803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.590723Z","title":"Efficient transformers: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.590723Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:3bf475c495bddaca896777e53810a2a02f5f151200b5da8ae02cfae68df832e5","observation_id":"e3bd59c1-1ccb-478f-a8b3-b2cbbb5fc033","resolution":{"observed_at":"2026-08-12T19:28:28.590723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.595998Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.595998Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:a176c8d3bdf6cdbfe8a931e3293afdf11955e6cb29612bf36713460ae75f6531","observation_id":"e9a4e19b-726e-4d44-8c51-8dc8033bb862","resolution":{"observed_at":"2026-08-12T19:28:28.595998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.601596Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.601596Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:bc50e4f70579d6df4c8e865abf22616f3a9d290576bc079cf92911f010ad20d5","observation_id":"e7d4007c-8d9e-44ba-9931-f2451f752490","resolution":{"observed_at":"2026-08-12T19:28:28.601596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.607247Z","title":"Parallelizing linear recurrent neural nets over sequence length","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.607247Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:6f8b37c1bcb5bc78b880320ca7901910082ce5ea90cbf3b740862710a5f61119","observation_id":"12f4dd21-8139-4370-a4f5-9d6c9b69ad92","resolution":{"observed_at":"2026-08-12T19:28:28.607247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12077","last_updated":"2024-07-16T18:00:00Z","snapshot_observed_at":"2026-08-12T19:49:57.289173Z","submitted_at":"2024-07-16T18:00:00Z","title":"GoldFinch: High Performance RWKV/Transformer Hybrid with Linear Pre-Fill and Extreme KV-Cache Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12077","snapshot_observed_at":"2026-08-12T19:28:28.612877Z","title":"Goldfinch: High performance rwkv/transformer hybrid with linear pre-fill and extreme kv-cache compres- sion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.612877Z"},"links":{"cited_paper":"/paper/2407.12077","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e0e9d6c885d05e981a3e06cd6a1d4c7d78c33a9b65c87177eb4c1fa848394429","observation_id":"d523d1d5-c9b6-46de-bf1e-f474972bdc4f","resolution":{"observed_at":"2026-08-12T19:28:28.612877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.618191Z","title":"The devil in linear transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.618191Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:dfb2fc7a4be1fe9a54f85aa09fdd508f54d0e2fc3920e066523d068fce426ee6","observation_id":"4395c9d1-6da2-4c1d-b620-1cef39dccee8","resolution":{"observed_at":"2026-08-12T19:28:28.618191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.622977Z","title":"Transnormerllm: A faster and better large language model with improved transnormer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.622977Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:776db872821ab8533709e0c787e0aa35b492773b11c70ffca8a61db1896afe28","observation_id":"a074658b-168d-410a-9370-76f642ca4254","resolution":{"observed_at":"2026-08-12T19:28:28.622977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-12T19:28:28.627795Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.627795Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e25051c6a5734e6e5ed24b94cb150b9503accece2b02756f992efad6159e5831","observation_id":"4ca69ee4-203d-4ea8-919a-81e66270cd41","resolution":{"observed_at":"2026-08-12T19:28:28.627795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.633967Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.633967Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b6f71a8849645fd2fbc4a3272add78b713775b75528988d168e70faedae3027b","observation_id":"4d2d8aef-48ad-4390-a0eb-b9884e60d086","resolution":{"observed_at":"2026-08-12T19:28:28.633967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.639640Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.639640Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:caa908e4e6005c8ef3c602adab1c7f898940f852c400dd6948244d4ddcfa6a3e","observation_id":"ae5ca70f-14e7-49a7-8c51-aa5cc63cd465","resolution":{"observed_at":"2026-08-12T19:28:28.639640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.644996Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.644996Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:5d98ed17fbe7d66113f455e4e134ed713a52b295a48b53875edab8cc0a64a544","observation_id":"e038d369-6f12-4e59-a501-c4d3fc352517","resolution":{"observed_at":"2026-08-12T19:28:28.644996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T19:28:28.652035Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.652035Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:be4f85da49ca1a5357e0087969cc75106755399cddb139be8f234dfae55a37cb","observation_id":"00c89e75-9697-4269-b1d7-89f40bde8b1c","resolution":{"observed_at":"2026-08-12T19:28:28.652035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.675769Z","title":"Orvieto, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.675769Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:694a5dbc307a1688bd1cfae7831be6d2f75d8354664edfc488121746f9783030","observation_id":"4beb0c1f-cd9b-41d9-9260-6d0c875132ae","resolution":{"observed_at":"2026-08-12T19:28:28.675769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.735792Z","title":"Hierarchically gated recurrent neural network for sequence modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.735792Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:c5eb455200585b0fcb38c977594f2614759adb04b4d9e3ae21ac2075d9ef433c","observation_id":"c4143991-4aef-4b32-8be2-ef5eb2a876bc","resolution":{"observed_at":"2026-08-12T19:28:28.735792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.833075Z","title":"Fu, Tri Dao, Khaled Kamal Saab, Armin W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.833075Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:5a838b41e7c29670aff92ae6eb39fb8f4970dea3dff81cc69704dab8f3cacd19","observation_id":"b8b45666-82b2-4cf1-8a45-2b6399e13efb","resolution":{"observed_at":"2026-08-12T19:28:28.833075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.974299Z","title":"Simplified state space layers for sequence modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.974299Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:ddad9218c600dce9aaa6c91707e3950c2f344b0901506297bd33d0b7371f4765","observation_id":"0a718acb-d305-4257-8e76-2ff52c4a90f4","resolution":{"observed_at":"2026-08-12T19:28:28.974299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:28.982890Z","title":"Various lengths, constant speed: Efficient language modeling with lightning attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:28.982890Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:c707f6ce7d38d452bb537303365319e2ca07e8e98d80b83212ee6f896be1e57f","observation_id":"5df85860-a92d-4c4b-8102-d092493a42c7","resolution":{"observed_at":"2026-08-12T19:28:28.982890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.000348Z","title":"Modeling Sequences with Structured State Spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.000348Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:deb5457046941e52e3e2fdfb8a8838bb1d95f27ec77e5ff9d7b69185691c2796","observation_id":"a6d3f49f-6ab7-4069-8ce1-f8aa318c24a2","resolution":{"observed_at":"2026-08-12T19:28:29.000348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.008024Z","title":"On the parameterization and initialization of diagonal state space models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.008024Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:4b94faef6c9acb80667c4fed5a2b928b50f308dddbed92cafff295b3ef39eb5f","observation_id":"6422eef5-4427-4174-9cec-ab3fc6db1bed","resolution":{"observed_at":"2026-08-12T19:28:29.008024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.014127Z","title":"Diagonal state spaces are as effective as structured state spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.014127Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:d8b9427c63a195220633fcdf27459a605471919094c2eb19aa52b6912d136baf","observation_id":"7fcf0492-4dbe-4afc-aebc-f21aa8d62853","resolution":{"observed_at":"2026-08-12T19:28:29.014127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.019317Z","title":"Hippo: Recurrent memory with optimal polynomial projections","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.019317Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:176a405bf5daa73af9668ff11017985ff89a656da7cf493a63e5a32137de3d33","observation_id":"b49b5146-3acc-4a59-a750-1249905c6c9a","resolution":{"observed_at":"2026-08-12T19:28:29.019317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.025175Z","title":"Wang, Hui Dai, and Yoav Artzi","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.025175Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e62c3beb4a0f69afe8187846814f05b499795e24fff52c0a569cd76caa508afb","observation_id":"243f3b77-099a-4da1-a69a-48fcb1d76a2e","resolution":{"observed_at":"2026-08-12T19:28:29.025175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.098390Z","title":"HGRN2: Gated linear RNNs with state expansion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.098390Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:dce8ecc8844edbbf2959d1348c2712eea7bd187b29ac4b58166b996ef4751f50","observation_id":"bb9896ed-203d-461e-a0d8-8cecf5fdb597","resolution":{"observed_at":"2026-08-12T19:28:29.098390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.205473Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.205473Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:0ad64b6ba64d398169d71f6ce2f331eacb200461cbee775f54eaa6a98750aacd","observation_id":"6b46549b-4e92-4125-a802-19b45f926849","resolution":{"observed_at":"2026-08-12T19:28:29.205473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.243952Z","title":"Random feature attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.243952Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e0a55f73a69fe0ac280ba4e522fc60056508a501a2579da0aa2d178cfe2f20f6","observation_id":"ed684719-4680-4e29-b61f-990e27a5fcec","resolution":{"observed_at":"2026-08-12T19:28:29.243952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.249548Z","title":"cosformer: Rethinking softmax in attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.249548Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:a7b28a21435dec05e5a72417163923d29e9272bc3c9bff794d43dd0ee1ea7bfe","observation_id":"e525986d-ad46-4c92-9d60-75e0a55514c3","resolution":{"observed_at":"2026-08-12T19:28:29.249548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.255519Z","title":"Strongly-typed recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.255519Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:940eb98c1394e5972958f4c0a8910e9a4d51a0debb87775214999eb0d994ff9c","observation_id":"8d7ea96c-729b-4302-9042-60bee9036bcd","resolution":{"observed_at":"2026-08-12T19:28:29.255519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.715063Z","title":"Mlp-mixer: An all-mlp architecture for vision","venue":null,"work_id":"d6ad96c9-eb36-4412-8014-cac757737c37","year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.262440Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:4d7337c47f0e4217ac08e2a8ba0098cbb8a02b695789fac79345887baa0be875","observation_id":"f80bbdf5-50b2-4e73-916c-1c55c06f98ec","resolution":{"observed_at":"2026-08-12T19:28:33.725868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.686570Z","title":"Metaformer baselines for vision","venue":null,"work_id":"bd349c2b-d706-4f0b-9c62-70f82b414b60","year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.267457Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b764243208a42fa400e148900cde1b88e859f9817ee42ebdd72c61af98f7b06a","observation_id":"6cf5994b-9113-401e-809a-81b3cd0b3a89","resolution":{"observed_at":"2026-08-12T19:28:33.693329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-05T07:11:50.808005Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-08-12T19:28:29.273585Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.273585Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:140183f3808e03480d3c39ee2e3ce349e4b23dbffea8a99e09374843bd758639","observation_id":"26b8b53a-c953-40ae-a1e9-3fa3f871e63a","resolution":{"observed_at":"2026-08-12T19:28:29.273585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-12T19:28:29.279038Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.279038Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:c5ea3846da673f7247f22f8b603f1ea0dc5e4de691403a279d8599f9582055a8","observation_id":"9b6fe16d-d39e-4104-96a2-5abcbe32b805","resolution":{"observed_at":"2026-08-12T19:28:29.279038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.655556Z","title":"Superglue: A stickier benchmark for general-purpose language understanding systems","venue":null,"work_id":"02b62614-10e7-4aaa-b344-9fa57060b500","year":2019},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.327111Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:a3a0b17a80b238501e8a3b71bffcf188a4652471ca1ae079603031226e2e27a3","observation_id":"4ba3dbde-c758-466c-8df1-b2454eea2b21","resolution":{"observed_at":"2026-08-12T19:28:33.664136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.621831Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":"84de020a-d627-45ce-9672-15e820bf1537","year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.366644Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e56033f920429c2cf6bd32223460b76a4e2ef8015a10f9a3010ccf975039edcb","observation_id":"35386176-002e-4600-884a-8bfb07ecbd77","resolution":{"observed_at":"2026-08-12T19:28:33.631461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.410235Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.410235Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:87ee982799fef681b370ae8a01f50963c83b90376da8ca33293d3d4425fa5496","observation_id":"f9d915e9-7159-4a45-a21e-2853d70b5445","resolution":{"observed_at":"2026-08-12T19:28:29.410235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.564431Z","title":"Mechanistic design and scaling of hybrid architectures","venue":null,"work_id":"2a3447a4-17a9-4431-a713-2d6681c04075","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.417593Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:ba6d5daa23a3b8becf7e2df1fbea359f1b0672b7dbf659a50603f53a2f55b9c1","observation_id":"3dd63893-993a-43de-a501-90aeb3c3065f","resolution":{"observed_at":"2026-08-12T19:28:33.575711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16690","last_updated":"2024-06-24T14:51:31Z","snapshot_observed_at":"2026-08-05T15:41:30.684979Z","submitted_at":"2024-06-24T14:51:31Z","title":"Scaling Laws for Linear Complexity Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16690","snapshot_observed_at":"2026-08-12T19:28:29.424463Z","title":"Scaling laws for linear complexity language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.424463Z"},"links":{"cited_paper":"/paper/2406.16690","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:61b2a0a4bc3e73480c30b0f3389db561ac399720c04f181dce6d47877e0821e0","observation_id":"2c2317fe-ac0e-4a03-99c1-13a36461a170","resolution":{"observed_at":"2026-08-12T19:28:29.424463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-08-11T04:39:27.148460Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-12T19:28:29.431197Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.431197Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:f2caccd8f25c666db2222729fe35abd37c42aab82c4abca5e08aba07cfbb7891","observation_id":"b15e2882-7c0a-4ffe-b4db-74a92faecc8e","resolution":{"observed_at":"2026-08-12T19:28:29.431197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.525377Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"4c0d7ae3-de00-4b14-9289-83b585e507ca","year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.436785Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:2fc6d3c37008352602da5eef69f30df5a9467f743732e3ddc127dbaad896f30c","observation_id":"cf01d797-e70f-41b7-8bba-ec4192c5ab51","resolution":{"observed_at":"2026-08-12T19:28:33.536752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.494390Z","title":"GPT-NeoX: Large Scale Autoregressive Language Modeling in PyTorch","venue":null,"work_id":"dfbf286b-aafd-428c-be82-3d0c93e08d1c","year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.442059Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b276ed65ace4e8715574175449ea2eebc8599b71e821575b81d06897035b68df","observation_id":"8856581a-e5cf-464d-92eb-56221ccd8f07","resolution":{"observed_at":"2026-08-12T19:28:33.505048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.462030Z","title":"Toeplitz neural network for sequence modeling","venue":null,"work_id":"5dbef519-1e74-4a64-8dab-09719662a8ff","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.447679Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:ccd4b491dc2a044138c90efe17e2a283a7ae2a1d924887404dd4f663c133168a","observation_id":"7f9b955c-0e76-4201-9874-c3c017014bc4","resolution":{"observed_at":"2026-08-12T19:28:33.469887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.290832Z","title":"Mega: Moving average equipped gated attention","venue":null,"work_id":"59369070-2e16-434d-afbc-0e98c2d21b55","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.453263Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:0a1ab23c6ae4672e10ef8a1653418b27734e0df86a5f08c0a83a2d9f17c737fb","observation_id":"e24c270c-9277-4846-bf35-e8d87c1e45dc","resolution":{"observed_at":"2026-08-12T19:28:33.355946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.262773Z","title":"What makes convolu- tional models great on long sequence modeling? In The Eleventh International Conference on Learning Representations, 2022","venue":null,"work_id":"21b07dcd-9b29-442f-989f-4b1a05c977df","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.458700Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:86b15140354e5c895ca638dbf86c322911f559a2d7fd72a10320634f4c64e012","observation_id":"4424d2b2-fb33-4cbc-957b-729346f9ffe7","resolution":{"observed_at":"2026-08-12T19:28:33.268775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.227059Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"c280c98d-e379-46b6-bcf0-5b38e5fd7362","year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.535056Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:947d297ed9bcb4264d8ef37df7ffc05097a8c06fa765a25be531161376dc3510","observation_id":"629bf5fc-49aa-4138-92b8-34a7aef52f3f","resolution":{"observed_at":"2026-08-12T19:28:33.240675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.204059Z","title":"The hedgehog & the porcupine: Expressive linear attentions with softmax mimicry","venue":null,"work_id":"6abaa555-e969-4881-b257-6daf5a0c35c2","year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.611650Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b12f3e27b8e258aa7cb8fc927e631e01abb3d54d0d6b6156256f1555273682bf","observation_id":"84868c01-1c6b-44a5-89cf-fa258c805042","resolution":{"observed_at":"2026-08-12T19:28:33.211430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.660648Z","title":"Never train from scratch: Fair comparison of long-sequence models requires data-driven priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.660648Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:9b9698f826108489cc93fdc6b6fc9a23db644cd7a142568ab0724bbb4178148a","observation_id":"10cf7c8a-56c6-4288-8b2a-3ffb9b64dbc7","resolution":{"observed_at":"2026-08-12T19:28:29.660648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.163530Z","title":"Finetuning pretrained transformers into rnns","venue":null,"work_id":"341ef297-0087-45f9-94b2-8bf2553820c4","year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.665711Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b5b832c59e20a77a2b54fed5b8a532bf0603149de83b209290c9817c550cd7b7","observation_id":"0f6b091f-5f92-4834-9dbf-8dd15516ba39","resolution":{"observed_at":"2026-08-12T19:28:33.170381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.083060Z","title":"Hybrid random features","venue":null,"work_id":"cf3c5c21-8695-4e9a-8f66-f079b17ea8b9","year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.671040Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:49899d85c918976ffe16514a087ba140eaeda1365725a0ce9be11cdce86b3969","observation_id":"506dbc62-6997-4f41-8ccb-916e22b6e0aa","resolution":{"observed_at":"2026-08-12T19:28:33.137745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.676324Z","title":"Nyströmformer: A nyström-based algorithm for approximating self-attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.676324Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:376e1af8af4c8d7172b3b19dd0b37a94ca1276722d03f3a8e680a93ef0cd3b5b","observation_id":"ab5508ea-d0d8-4c66-aa9a-392a3dbede42","resolution":{"observed_at":"2026-08-12T19:28:29.676324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.680949Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.680949Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:6b521e62760ff47f94b9ed35e4e0030714a7c8cd10e0693df802e16aa5abfdcd","observation_id":"c6e27a0e-ed54-417b-8b4a-eb023ff0359a","resolution":{"observed_at":"2026-08-12T19:28:29.680949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.686157Z","title":"Networks of spiking neurons: the third generation of neural network models","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.686157Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:846537ac7911cbc3902a243e9e4f9c783c81e8c8b95445112233f86c9fe902d1","observation_id":"ec6caad0-0395-4e61-88bf-a05be0ea85ea","resolution":{"observed_at":"2026-08-12T19:28:29.686157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.691833Z","title":"Attention spiking neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.691833Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:cd1956cd5c99cc844678875c3ffb6b024600b899f56d5afae386f8ba11c8f167","observation_id":"5f86ee49-3240-46eb-b72b-32e2879c38f9","resolution":{"observed_at":"2026-08-12T19:28:29.691833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.696900Z","title":"Spike-based dynamic computing with asynchronous sensing-computing neuromorphic chip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.696900Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:67858daf464ba02ab85862dc53f04e84a5cdb0948baf5f7df0c301a47075d1ab","observation_id":"95c29368-54d1-4ba3-a17d-11c281a4e046","resolution":{"observed_at":"2026-08-12T19:28:29.696900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.869257Z","title":"Brain-inspired computing: A systematic survey and future trends","venue":null,"work_id":"9b0b2f92-2e4f-48cc-add8-0c5f734acd42","year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.701911Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:7a985d22addea56ec6cd400884c8ffa2d345706868820ff227e0e4d0eeff1553","observation_id":"1aeb4176-1f56-4091-a411-5b82156c1599","resolution":{"observed_at":"2026-08-12T19:28:32.921467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.843672Z","title":"Spike- driven transformer","venue":null,"work_id":"28bcb711-8aee-478e-bdea-e1976b0e4449","year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.707502Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:a5390e7fe4583c6d3d6f3d82ac25a08ec9ab667dcbe32a668605d46cf4ebcedd","observation_id":"45aa2243-e590-4d17-9450-abb6016aee68","resolution":{"observed_at":"2026-08-12T19:28:32.851746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.719680Z","title":"Spike-driven transformer v2: Meta spiking neural network architecture inspiring the design of next-generation neuromorphic chips","venue":null,"work_id":"3463166d-7a5a-4666-afd7-fbcfe1164551","year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.713143Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:96df7d5a1e6349dd5bacee4ecd136330067c52c1c27eb92deb5427b528ae0ab9","observation_id":"7c796d07-ee9f-4355-a2d0-d1e2f10fe6fa","resolution":{"observed_at":"2026-08-12T19:28:32.783164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.694859Z","title":"Transformer quality in linear time","venue":null,"work_id":"627672a1-9620-435f-a9a3-0b9a4df6e3a3","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.718706Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:fc1636df39feaafc6ea9be140e49bd18e378db312f122fcf144fb5d8038fbbd6","observation_id":"7062e33d-3b11-46e4-8155-64bd65e2678b","resolution":{"observed_at":"2026-08-12T19:28:32.703980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.617494Z","title":"Fine-tuning pre-trained transformers into decaying fast weights","venue":null,"work_id":"f5f13384-7109-4608-a433-4e9fe8e735c3","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.723763Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e8bb3b0f0f046710a727f965cb161e43f2d53ef3c64045a5f5d6b3632332cc8d","observation_id":"ecfd5c89-1280-4d5a-bbe7-286b1598b5b6","resolution":{"observed_at":"2026-08-12T19:28:32.666128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01927","last_updated":"2024-01-27T14:52:52Z","snapshot_observed_at":"2026-08-11T22:03:31.875404Z","submitted_at":"2023-11-03T14:08:39Z","title":"GateLoop: Fully Data-Controlled Linear Recurrence for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01927","snapshot_observed_at":"2026-08-12T19:28:29.729282Z","title":"Gateloop: Fully data-controlled linear recurrence for sequence modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.729282Z"},"links":{"cited_paper":"/paper/2311.01927","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:67691668c695908fcc618d5080ae2aeadb21051aa09ed636ee42e70b8ba8d73b","observation_id":"161f766f-59aa-42d7-83b3-44d076c0b5f1","resolution":{"observed_at":"2026-08-12T19:28:29.729282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.568186Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers","venue":null,"work_id":"fefd4bb1-811b-4c9d-a3ed-d3146aa4277b","year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.823502Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b68b152ecbb12dbefdbf562a4bb497cc74a17b74cc6118b4e5997237d956f48b","observation_id":"2b86f549-cd77-4078-8023-a76d1ef724a6","resolution":{"observed_at":"2026-08-12T19:28:32.577892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.887185Z","title":"Long range language modeling via gated state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.887185Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:2a627209c112d723b5cbcac4fbeb88c5637404b111e367b29c5944aa8fcad111","observation_id":"11a28ceb-7edd-4bf9-a9c5-fca84435ff0b","resolution":{"observed_at":"2026-08-12T19:28:29.887185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.458856Z","title":"Pretraining without attention","venue":null,"work_id":"a0f4b565-e48c-4d4f-be6a-3d77425b716c","year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.894365Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:51ca6a8473e21e6dca6cd6b5819c17b30cc812ec5316dfe342ed7203b7edf2a6","observation_id":"00b6d505-2381-4d56-925d-01fc6955dc1a","resolution":{"observed_at":"2026-08-12T19:28:32.497604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:29.901270Z","title":"Hyena hierarchy: Towards larger convolutional language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.901270Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:7a32dbaea4c644d6c3454d5ef73f2f529a50247c51465ec95d5b1bf925d3bfac","observation_id":"fe7a2b06-cc62-4fc0-94ba-d319cf7afda1","resolution":{"observed_at":"2026-08-12T19:28:29.901270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.401725Z","title":"S4nd: Modeling images and videos as multidimensional signals with state spaces","venue":null,"work_id":"9978b0d6-2b95-4843-8f13-f7f2139d9d46","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.913499Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:322b390d035fa4ffcb51785f34e60ca10d40ebf642376eeba31cdd84b6672b76","observation_id":"c4c2a0be-1caf-4629-90ed-b758caa25858","resolution":{"observed_at":"2026-08-12T19:28:32.415127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.288464Z","title":"Liquid structural state-space models","venue":null,"work_id":"c41d34bc-03d1-41df-bfd3-93e1f3d41241","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.941277Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:4f98df598d2d6834495591e6f3e9a68ed5836777446081ffb0b4d98ba2e02a46","observation_id":"03c088f3-5464-4068-b9db-ed894d9c8f2d","resolution":{"observed_at":"2026-08-12T19:28:32.352376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.265497Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling","venue":null,"work_id":"1fe93031-a7f3-4bb5-98ae-46409e7f8f1e","year":2014},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.979063Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:70ad5b77d5853af716d6f8ad44da1b5b50a3680b6db833e89537420066ffffdf","observation_id":"4a1b4dfa-a0a0-4314-b565-98af334ad950","resolution":{"observed_at":"2026-08-12T19:28:32.272974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.150731Z","title":"Graves and A","venue":null,"work_id":"35697052-1f2e-4430-8b49-cd3407574d00","year":2012},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:29.995940Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:bc98599af2ba322b6efe76d647a454bfe57308564e512b919c6b9e0931af4a87","observation_id":"a6a0b545-d8b4-44b9-821d-fc5350428c61","resolution":{"observed_at":"2026-08-12T19:28:32.188557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.118593Z","title":"Learning to forget: Continual prediction with lstm","venue":null,"work_id":"b9a043b3-a824-43bd-9795-9277a584c60a","year":2000},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.004082Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:493593bb4ffab87a8deb19b04803a060c5d53e64b04dc49e1cf738f74f62405d","observation_id":"13ea700b-ad21-46f6-ab0e-17dd5785d4b2","resolution":{"observed_at":"2026-08-12T19:28:32.127726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.061850Z","title":"Linear dynamical systems as a core computational primitive","venue":null,"work_id":"03ec6f7f-e4f3-4ea9-8382-b382b525b008","year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.010505Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:c576c02f83e1d8472b28d0f339a891b17d538978bed05c9ed86445b5924762b3","observation_id":"9ae0ea9b-a6a7-4814-8fe4-ad346a6eea2b","resolution":{"observed_at":"2026-08-12T19:28:32.100352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11888","last_updated":"2024-06-05T10:00:40Z","snapshot_observed_at":"2026-08-05T17:27:18.136855Z","submitted_at":"2023-07-21T20:09:06Z","title":"Universality of Linear Recurrences Followed by Non-linear Projections: Finite-Width Guarantees and Benefits of Complex Eigenvalues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11888","snapshot_observed_at":"2026-08-12T19:28:30.017336Z","title":"On the universality of linear recurrences followed by nonlinear projections","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.017336Z"},"links":{"cited_paper":"/paper/2307.11888","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:a7fc26b9486b8ca44e1d450c486f785b6a7dc5bb6de9e3bb19a5911c0a986645","observation_id":"b97ea4b9-9621-493a-921d-69a8cc72d283","resolution":{"observed_at":"2026-08-12T19:28:30.017336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.988697Z","title":"Quasi-recurrent neural networks","venue":null,"work_id":"98c31ee3-cc61-43cf-aa5d-fdd5802f2fbe","year":2016},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.057642Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b7aff47d19166275eaf6c42ca46de869a3b514b9700ea8bfa8a07fecc75bddf0","observation_id":"9656a8fd-668a-4800-ada8-3e366323b9da","resolution":{"observed_at":"2026-08-12T19:28:31.997326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14103","last_updated":"2021-09-21T18:04:55Z","snapshot_observed_at":"2026-08-12T10:40:58.838350Z","submitted_at":"2021-05-28T20:45:30Z","title":"An Attention Free Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14103","snapshot_observed_at":"2026-08-12T19:28:30.076777Z","title":"An attention free transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.076777Z"},"links":{"cited_paper":"/paper/2105.14103","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:66d12fe5b8cbe4d6c5a7b4250b02e381fa7e26cee1ff0d2b7f9aecfe58425aee","observation_id":"89904bcf-c5b6-4d08-b38b-4d3a7c3baa6e","resolution":{"observed_at":"2026-08-12T19:28:30.076777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.964386Z","title":"Efficient attention via control variates","venue":null,"work_id":"d41d15c4-095c-4560-b8fb-cc5fa67fade5","year":2023},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.093858Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:8ccc91c45f8349acb37794d5f3449493f0f43d059034f0d0f3a13c1dc86c829d","observation_id":"a10137d4-8ff8-4aed-a6f8-8c3d9ac90e6e","resolution":{"observed_at":"2026-08-12T19:28:31.971488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.884906Z","title":"Fla: A triton-based library for hardware-efficient im- plementations of linear attention mechanism","venue":null,"work_id":"cff752cd-f968-4df4-84d5-7ca8c0441089","year":2024},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.100184Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:560565ef719ec7f8ca182fce2b7f1be9f630cc92e3a34f57a8c970f550476368","observation_id":"f1cc5f84-c765-4849-a0bd-4f5a0802e4d8","resolution":{"observed_at":"2026-08-12T19:28:31.946743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-10T23:14:34.195361Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-12T19:28:30.106724Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.106724Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e01cb2ae9d2142d9961b340b1c94427304f9ba5a3ca7800cab91f8967d21f631","observation_id":"3a32fdaf-acfd-4003-bb1f-d01591e68b47","resolution":{"observed_at":"2026-08-12T19:28:30.106724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.810757Z","title":"Logiqa: a challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":"3f251220-423a-41e6-94d3-1b969baea4a7","year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.126314Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:6b589a85135dc5854fe6e267e381ec90dbc01cbedafe825a9ed0355c93a4abe3","observation_id":"63fa2bbc-1e30-4a29-82d8-38f5838316e8","resolution":{"observed_at":"2026-08-12T19:28:31.817955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.788694Z","title":"The winograd schema challenge","venue":null,"work_id":"aa8a71e6-53bb-4f23-b8ff-149f01cb897d","year":2012},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.132034Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:4c17e73740a11f5b4c714ce68375097e0df19a70e8609c0cbfa5a366d494eca8","observation_id":"abbb2e70-cf63-451f-94af-17053891d733","resolution":{"observed_at":"2026-08-12T19:28:31.795150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:30.137612Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.137612Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:6e56d2f3fa8a0462f7d24af421c4e4e2ef77d98d94b96995a3223a69e97cbf46","observation_id":"d6c63930-d8bb-4221-bc25-9962c180bbc5","resolution":{"observed_at":"2026-08-12T19:28:30.137612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.757813Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"2a7b2aba-891d-4b0b-a736-123ca69464ed","year":2020},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.144348Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:8bf2b1514fbdb8d1b60699784ab005e160cf331fa7cfa859a69b132922b1d04c","observation_id":"5279b2e6-3b2f-4eba-a98f-967999f1c9a4","resolution":{"observed_at":"2026-08-12T19:28:31.763124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.732996Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":"c2a1d821-45a9-40fd-b6ef-5a2dc6f64113","year":2019},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.150791Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:f114f82bf3e4b9a459712b879b104e9004be1c0271a05fdcf3a895bd7927bc62","observation_id":"af29ae7e-d588-4ee3-a1ec-bb34dbc4c893","resolution":{"observed_at":"2026-08-12T19:28:31.740551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:30.157019Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.157019Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:3a77574e99b5c253230e59ee480eb5b5215d6f68049de227e2bcd2eb2ed34a64","observation_id":"efff8d06-af15-498a-ad01-bae114feb876","resolution":{"observed_at":"2026-08-12T19:28:30.157019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-12T19:28:30.162921Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.162921Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:69cb81ce4afd852c87b34efa3dd6c4155e3f03d7cd1f491e0d50fa6901665a5b","observation_id":"7629280a-2d8e-4ee9-824a-1bdc1116f11d","resolution":{"observed_at":"2026-08-12T19:28:30.162921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:30.169129Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.169129Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:db667220ed010fd6a0c06c1d9763ccd042d52a939f53a1a79ad33cfb826c60f1","observation_id":"29f4efde-e11d-4c34-af11-5a56e899fe03","resolution":{"observed_at":"2026-08-12T19:28:30.169129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.662721Z","title":"A framework for few-shot language model evaluation","venue":null,"work_id":"7a3576e5-a1e8-4ea3-8492-d943b456aaa6","year":2021},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.175781Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:d66c03c805178f41975351bad003174c5506a9103756c2d4dfed954d1bb2a567","observation_id":"2c6d6a41-f094-45cc-a756-8e5ddeca5f8d","resolution":{"observed_at":"2026-08-12T19:28:31.669207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.632818Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in Neural Information Processing Systems, 35:16344–16359, 2022","venue":null,"work_id":"e7201514-ba95-48d3-8fbc-dae629804629","year":2022},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.183942Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:835af772d397d18a680fc8f19c34b0fad300ba61f40e8c075e31073d7797014e","observation_id":"060d97d7-5ec3-44c9-b785-a85fda3ff9d2","resolution":{"observed_at":"2026-08-12T19:28:31.642916Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.523318Z","title":"including recall, memorization, and compression","venue":null,"work_id":"9aa4ad84-dad2-491d-8992-eaff771034de","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.190700Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:de35094bc51386dd55a215a0a0561c64437394ff5b0734c13e0584359367f7a0","observation_id":"02220aff-416d-41b8-b39b-bd1c065ece27","resolution":{"observed_at":"2026-08-12T19:28:31.575640Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.471807Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"5b3909a2-2cb5-4eee-b391-b17f7c5ab972","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.195948Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:6d6ca8040eddd21645798cf7011f2167ef9036a8261ce1e706c3b244f9eb401e","observation_id":"d0702585-005b-4b63-b85c-569a522ec130","resolution":{"observed_at":"2026-08-12T19:28:31.479910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.454040Z","title":"Limitations","venue":null,"work_id":"36c62dd6-dd0c-42b4-ae61-719534846ab0","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.201146Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:10b83d68ce5aea31eb0e92d69e3f006942d0fc4eed3b7433a45c365a35ccc0bc","observation_id":"e8d313b8-d128-41b8-80c2-d5501e060859","resolution":{"observed_at":"2026-08-12T19:28:31.459561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.436190Z","title":"4 and appendix A2, we provided the definitions and detailed proofs of our theory","venue":null,"work_id":"8a3ee673-1ddd-45c7-b146-f4670cf22bd3","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.206848Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:e6d9504899d92f18dc5299805755b9525dbc28740c980588bd9c737b7404ef2c","observation_id":"e33f776e-cf2c-4ebf-a77f-e5dbd772bab8","resolution":{"observed_at":"2026-08-12T19:28:31.441915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.416976Z","title":"6, we showcased our experimental setup and the results, and in appendix A4, we further elaborated on the details of all experimental setups","venue":null,"work_id":"aee32f5d-602d-42c6-b2b3-0a442a6340e4","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.212053Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:b72e6b3d31b9d9e148d89bc437620fddc1f9862cda83dbc83dc6d55493431216","observation_id":"9a06316d-7323-497c-a8ce-df87ca9eabdb","resolution":{"observed_at":"2026-08-12T19:28:31.423376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.323285Z","title":"6 and appendix A4 to ensure the reproducibility of the results","venue":null,"work_id":"42632d00-9f5b-42fc-b6dd-7021239b8c26","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.218861Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:d570e5cb291cba0e19c244888a03754d19c3d984dfaa6dd7d979003058488ebe","observation_id":"608ea057-ce4e-488b-97a7-45f7797d3b7e","resolution":{"observed_at":"2026-08-12T19:28:31.356628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.246232Z","title":"6 and ap- pendix A4","venue":null,"work_id":"589f26ad-6dc9-4384-83e4-2ef5c68aa6e8","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.225249Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:02ed5573c86ddda1a9b934be3e6a695b805fedde52732ad08d25e14696ff3f55","observation_id":"f6550875-6b7e-496e-9cbe-5012a707947e","resolution":{"observed_at":"2026-08-12T19:28:31.287000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.108387Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"3caa4479-2cca-4e36-831e-0f52f63a68d1","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.230186Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:112851cbc774905a277ba6565f5180bacd030cda71e5d27609d56278ce22a8cf","observation_id":"2efa4890-71c8-4c0e-a45e-3d930f84f314","resolution":{"observed_at":"2026-08-12T19:28:31.187468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.089017Z","title":"6 and appendix A4, we provided details about the computer resources used for the experiments","venue":null,"work_id":"efad6781-babd-4a21-a2a1-c27cd6761f67","year":null},"citing_paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:30.235477Z"},"links":{"citing_paper":"/paper/2411.10741"},"observation_digest":"sha256:467eb1765ac8f7f1ebbdf2e44ff19c4172fb1d773b6bfb324fb7008b72f4ee93","observation_id":"346dfad7-c842-4997-96a9-6c1b695e912b","resolution":{"observed_at":"2026-08-12T19:28:31.095865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10741","last_updated":"2024-11-16T08:47:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T19:19:03.127654Z","submitted_at":"2024-11-16T08:47:32Z","title":"MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":107},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 107 outbound references and 1 inbound Pith citation observation for arXiv:2411.10741."}