{"as_of":"2026-08-16T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26000931fa8173c8bf3d474d637068e6cf58a7c34d3daeab4ad5b4f6d927422a","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:57:17.815280Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08516/citation-record","integrity":"/paper/2505.08516/integrity","json":"/paper/2505.08516/citation-record.json","paper":"/paper/2505.08516"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.962732Z","title":null,"venue":null,"work_id":"598333b4-5a4e-42ce-a27c-88859d74620e","year":1985},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.511900Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:8d7f5bfb219456a3a1b4e0b5869215c2b01783dbb3e7917094e3e4de5c968fa9","observation_id":"98e6bf58-f929-4485-9f5a-0a5401db36e0","resolution":{"observed_at":"2026-08-15T21:57:18.968227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.902927Z","title":"Convolutional neural net- works on graphs with fast localized spectral filtering","venue":null,"work_id":"3ae91228-35cd-4793-9b29-c81abf08c091","year":2016},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.559334Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:fd23969e2e4518b1d0253c19501e631d72f07530ef752c40da98280b4cf21dbd","observation_id":"7156175b-fc6d-49a5-87cb-f74c1d17f565","resolution":{"observed_at":"2026-08-15T21:57:18.911068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-15T21:57:17.575000Z","title":"Mamba: Linear- time sequence modeling with selective state spaces.arXiv preprint arXiv:2312.00752,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.575000Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:9654472076885622bf22b115018ea791f5d53c9aefb1f610cb7a51e09cc1ecc6","observation_id":"fab96221-ba65-426a-8349-7517cf3f2019","resolution":{"observed_at":"2026-08-15T21:57:17.575000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-15T21:57:17.579965Z","title":"Efficiently modeling long sequences with structured state spaces.arXiv preprint arXiv:2111.00396,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.579965Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:fc22b85b91544000b388eee96d31899a9361232e10dd10eb0fb0226ad64a9baf","observation_id":"f504c40d-53c5-4954-b50b-f360125ac925","resolution":{"observed_at":"2026-08-15T21:57:17.579965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.846379Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"21e59fff-a26b-4b62-9947-4d4f065efbaa","year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.585060Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:d53f9d49bdb614396a51cfe8db239c5e10014502ecab72e4046f7416c9d38211","observation_id":"04ea3883-a469-4bb9-84f3-2c0f785c2072","resolution":{"observed_at":"2026-08-15T21:57:18.851708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.828486Z","title":"Polynomial-based self-attention for table representation learning","venue":null,"work_id":"ae273ff6-a1a8-4023-88d6-f71c89705ea3","year":2024},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.590050Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:f9444e6f75de9f192bb1ef8bf96d291cf70e931b9f746202287b81384e5754df","observation_id":"2acace47-04af-44de-aa97-74ef05e707ed","resolution":{"observed_at":"2026-08-15T21:57:18.834642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.809239Z","title":"Kipf and Max Welling","venue":null,"work_id":"a02324d9-13ae-477e-ab52-521bd4b3755d","year":2017},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.595076Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:b11c0ce24b71ab04ccc42516f368e92f7746c622af3c80b70081b699840eeb5b","observation_id":"008abe6f-c714-4489-9f2c-0675ba2fea3b","resolution":{"observed_at":"2026-08-15T21:57:18.815547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:17.605663Z","title":"Learning multiple layers of features from tiny im- ages","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.605663Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:86a292bf52375de0b9cd180f1bc7f601001ed0b454929155ba7f42fcd4c8e147","observation_id":"bd5d0fed-d148-441a-a3ca-e79b69a13c6a","resolution":{"observed_at":"2026-08-15T21:57:17.605663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.778634Z","title":"En- hancing the locality and breaking the memory bottleneck of transformer on time series forecasting.NeurIPS,","venue":null,"work_id":"1834521c-3e2c-4317-b729-061a93d19796","year":2019},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.610356Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:b973e921eb24ea50b648e138bcb0a5d7ab2dc1a10b7d157c4263005b899550ee","observation_id":"9791ca9b-df4f-4e76-a0ae-3529d4102ad8","resolution":{"observed_at":"2026-08-15T21:57:18.784247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.760683Z","title":"Learn- ing long-range spatial dependencies with horizontal gated recurrent units.NeurIPS, 31,","venue":null,"work_id":"1122855b-7888-4ac1-9304-05dca9cf94e0","year":2018},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.616580Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:c683c32eefad730aad27f0e915b0fb3033e08325ee364ca1d7975a65e6072d2c","observation_id":"97fdb760-ddef-448e-bbe2-0d2cbb2998e3","resolution":{"observed_at":"2026-08-15T21:57:18.766152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.743169Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"1f8820e4-7f62-454b-9b72-808764b63f31","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.621628Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:206a8e9c127a1b3f71b6d67ff2f25651a0d24619a7ab0f93ecfc021373764817","observation_id":"ce06b96d-6902-433e-897b-187fbb940174","resolution":{"observed_at":"2026-08-15T21:57:18.748810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.725668Z","title":"Soft: Softmax-free transformer with linear complexity.NeurIPS, 34,","venue":null,"work_id":"2e769ff0-c0e1-43c4-b49a-0a6f4fefa86c","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.626803Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:58457040705748811cd835eea338efb49b3a4f3805ac7b115278efd4b22fdc25","observation_id":"196b12bf-e9c7-4494-88fc-4947f78d77c5","resolution":{"observed_at":"2026-08-15T21:57:18.731294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.708415Z","title":"Learning word vectors for sentiment analysis","venue":null,"work_id":"a8bf2a58-8d05-4422-9912-27929ab78f2e","year":2011},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.632038Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:46e9464a0d758cf2580062fc097348bacc00ba4ab0f4846f95519d319b457a34","observation_id":"bcbcce1c-9ecc-4e30-9fa8-0f0362498d57","resolution":{"observed_at":"2026-08-15T21:57:18.713811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.669317Z","title":"A fractional graph laplacian approach to oversmoothing","venue":null,"work_id":"53272ba4-c289-4b28-b0ea-ac18f2357687","year":2023},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.643410Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:843b034bad76e4f2c09648c2b61415c777ac95aad462790d1bd544dd1fb09899","observation_id":"bc22d431-bfb5-4b70-a894-a232c9c2adb9","resolution":{"observed_at":"2026-08-15T21:57:18.675251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.649225Z","title":"Generalized legendre polynomials.Journal of mathematical analysis and applications, 177(2),","venue":null,"work_id":"bc2f9806-0d93-4178-8741-de622d670cb5","year":1993},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.649224Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:373b141f2279f53dffb1c45741d37a050316e50a0440fe20b7808cdea0f7e744","observation_id":"5d602aa1-e249-43b0-bd83-aace1a115b1e","resolution":{"observed_at":"2026-08-15T21:57:18.655709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.628265Z","title":"Graph neural networks exponentially lose expressive power for node classification","venue":null,"work_id":"f2d81ae1-c0a0-451e-9859-622d1990b019","year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.660665Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:d8e1c3504cf1025428908b6243e89225e1b1a3c7bc5a864a2fc36cc76e0611c8","observation_id":"6e2bcfaa-87f2-4920-9ba9-cd384dc00c98","resolution":{"observed_at":"2026-08-15T21:57:18.635128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.608648Z","title":"Graph signal processing: Overview, challenges, and ap- plications.IEEE, 106(5),","venue":null,"work_id":"8648d5e0-30d2-4b85-89b8-56df64b396bf","year":2018},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.665763Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:ac721e540d6e75bb8a5c107956d2c85d1ddef9717659c994c177aa8fdec01b18","observation_id":"7d13de08-3407-43b6-98ce-5ab8796e3ef8","resolution":{"observed_at":"2026-08-15T21:57:18.615378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06446","last_updated":"2023-04-14T22:20:46Z","snapshot_observed_at":"2026-08-13T12:03:37.160456Z","submitted_at":"2023-04-13T12:27:17Z","title":"SpectFormer: Frequency and Attention is what you need in a Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06446","snapshot_observed_at":"2026-08-15T21:57:17.671110Z","title":"Spectformer: Frequency and attention is what you need in a vision transformer.arXiv preprint arXiv:2304.06446,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.671110Z"},"links":{"cited_paper":"/paper/2304.06446","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:3183aeb4c7db4f3b126f39ca9289ba20bfe0d9bc23680b9788c99ad227b146a8","observation_id":"8c3899be-eeae-4b73-8a3c-f3118475a843","resolution":{"observed_at":"2026-08-15T21:57:17.671110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08791","last_updated":"2022-02-17T17:53:48Z","snapshot_observed_at":"2026-08-14T09:24:23.495530Z","submitted_at":"2022-02-17T17:53:48Z","title":"cosFormer: Rethinking Softmax in Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08791","snapshot_observed_at":"2026-08-15T21:57:17.676760Z","title":"cosformer: Rethinking soft- max in attention.arXiv preprint arXiv:2202.08791,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.676760Z"},"links":{"cited_paper":"/paper/2202.08791","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:8eb6177b55faf993602dfaba44cf7050dc3061eccad61f88baf617f01854e7f6","observation_id":"1dc307d8-cbde-40c7-9a91-1ba019a991d4","resolution":{"observed_at":"2026-08-15T21:57:17.676760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.548750Z","title":"Etc: Encoding long and structured inputs in transformers","venue":null,"work_id":"32d50187-91e4-4e34-a7ff-0cd6b1885c60","year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.691785Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:cf7e042b6103edab0433cd2bd64fadf8617dde9362115ea5ccd2bf9f2b434dd1","observation_id":"2690bbf9-2acb-4636-a39f-404f9b241761","resolution":{"observed_at":"2026-08-15T21:57:18.555209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10993","last_updated":"2023-03-20T10:21:29Z","snapshot_observed_at":"2026-08-13T12:20:52.753435Z","submitted_at":"2023-03-20T10:21:29Z","title":"A Survey on Oversmoothing in Graph Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10993","snapshot_observed_at":"2026-08-15T21:57:17.696978Z","title":"Konstantin Rusch, Michael M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.696978Z"},"links":{"cited_paper":"/paper/2303.10993","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:8c7682f50f2ff861d621b3984f7717b477fb8b5005f4d92e7e781a3e1c2949c6","observation_id":"a3c8922c-05f2-4e70-b029-6af2188f8840","resolution":{"observed_at":"2026-08-15T21:57:17.696978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.525456Z","title":"Imagenet large scale visual recognition challenge.IJCV, 115,","venue":null,"work_id":"0fc57345-1efe-437c-a8e3-ac1dd4b4b9c7","year":2015},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.702243Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:bcaf9f4457615aa32239da21c062846aaff91b10439e7dc8e0e02d6aa7336916","observation_id":"af5222c3-469a-46cf-a61b-0361fa3f589c","resolution":{"observed_at":"2026-08-15T21:57:18.531946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.478088Z","title":"Revisiting over-smoothing in bert from the perspective of graph","venue":null,"work_id":"8483bba4-e923-47c9-b940-9e7e65f658d8","year":2022},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.712808Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:11cdd050aed20a8039b3d3f36c0fe777b79338ef0408375aa981ab55a5bb9248","observation_id":"7133a0db-fb24-4244-9197-54d7616ce796","resolution":{"observed_at":"2026-08-15T21:57:18.485309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-08-09T15:12:21.086848Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-15T21:57:17.717884Z","title":"Long range arena: A benchmark for efficient transformers.arXiv preprint arXiv:2011.04006,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.717884Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:1607ad090580d64950205e0180f734d706f946dbb26929ad70a8beca91bcdf53","observation_id":"0a93b7e2-a23a-485b-b0e3-63105dee2209","resolution":{"observed_at":"2026-08-15T21:57:17.717884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:17.723717Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.723717Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:0a1c51d7d28b52ded422772d05af29e76387e6499f00dd100303ef62cedb29d8","observation_id":"940d99b3-9bb2-4ae4-aea1-f4e4b6534499","resolution":{"observed_at":"2026-08-15T21:57:17.723717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.443071Z","title":"Graph Attention Networks","venue":null,"work_id":"c5dd6eb5-c694-4c4f-b3eb-a22d5df2602d","year":2018},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.729118Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:d81a541ddd5a1bf32e28c2721de9b2cf85a5c924d38d920d9643f63ff058b9d5","observation_id":"891f33d6-f89c-4183-a92d-599ee24cefef","resolution":{"observed_at":"2026-08-15T21:57:18.449108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.426337Z","title":"A tutorial on spectral clustering.Statistics and computing, 17,","venue":null,"work_id":"3422146e-40a0-497b-ba3b-6855189a107a","year":2007},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.734217Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:40b7ae1e08bbd7c70a5d33b60bdc232f8932cc30e2c524faa61909d9c34ea7f1","observation_id":"4b5adb61-fa5f-4303-a043-934ef4af84db","resolution":{"observed_at":"2026-08-15T21:57:18.431542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.408238Z","title":"Anti-oversmoothing in deep vision transformers via the fourier domain analysis: From theory to practice","venue":null,"work_id":"5aee8611-8079-4df4-b1f1-081e376e5d06","year":2022},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.746102Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:bcb10a6eadb8ce27aeb97be5481df867e3d67945022b981c6562fa0db374eec2","observation_id":"089a2686-007b-4553-99e1-ee65b73bf00a","resolution":{"observed_at":"2026-08-15T21:57:18.414220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.389208Z","title":"Autoformer: Decomposition transform- ers with auto-correlation for long-term series forecasting","venue":null,"work_id":"9fc9abc6-a266-46d3-9a0b-971c79875b47","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.751840Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:0fbd79356829d169aaac445277b5a44d4370d86eae43aab37798e2e0cd7050b3","observation_id":"aefa1197-314d-480e-aabd-09632ebf335f","resolution":{"observed_at":"2026-08-15T21:57:18.395073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06258","last_updated":"2022-06-16T13:48:47Z","snapshot_observed_at":"2026-08-13T16:42:18.575845Z","submitted_at":"2022-02-13T08:44:10Z","title":"Flowformer: Linearizing Transformers with Conservation Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06258","snapshot_observed_at":"2026-08-15T21:57:17.757423Z","title":"Flowformer: Lineariz- ing transformers with conservation flows.arXiv preprint arXiv:2202.06258,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.757423Z"},"links":{"cited_paper":"/paper/2202.06258","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:448191db4508e8730a98505b7984421d41aa18b0f0fd1978c7764ddd052e6dde","observation_id":"ffe053dd-f1d9-4001-b9d9-27d2cbfb26ff","resolution":{"observed_at":"2026-08-15T21:57:17.757423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.369964Z","title":"Singularformer: Learning to decompose self- attention to linearize the complexity of transformer","venue":null,"work_id":"eeb946b3-8d7b-4f32-b3ad-e125cfcc6eed","year":2023},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.763040Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:a0b107bbe01542009a520b9567675762a99c39e6d3e1bc3673bff5cf20bce0f1","observation_id":"1ab38d05-c630-4062-9881-c3479386b0e0","resolution":{"observed_at":"2026-08-15T21:57:18.376767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.346189Z","title":"Nystr ¨omformer: A nystr ¨om-based algorithm for approximating self-attention","venue":null,"work_id":"a9d1c2b0-570c-4f6f-8b08-6555720c4206","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.768661Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:03ec35128c9bdac58fdeb70616e30d556e3cca6d22538e0af4e7ee46e916ebff","observation_id":"20c34074-9d1b-44c9-b3bd-43bf91f9c4f6","resolution":{"observed_at":"2026-08-15T21:57:18.352145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.328524Z","title":"Learning flexible body collision dynamics with hierarchical contact mesh transformer","venue":null,"work_id":"c241e58b-220f-4ca2-9a1f-246b7787804f","year":2024},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.774464Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:41139ecbe30ff5130d3d772ac4f3460b7c59323c22457509c5f2b0b50ee61811","observation_id":"09de7a9a-e8fd-4f10-aa2c-b2528b8c6f35","resolution":{"observed_at":"2026-08-15T21:57:18.333727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.306756Z","title":"Big bird: Transformers for longer se- quences.NeurIPS, 33:17283–17297,","venue":null,"work_id":"f1bcc51b-33d8-4e5a-88da-5b05084dbb05","year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.780595Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:e0d911b9af52b8e373b12a01d03755a5bbb46f19bfb65ac7c5fddf10beba0604","observation_id":"dbcf2d3b-2a0b-42ec-b9bb-3653370a3b97","resolution":{"observed_at":"2026-08-15T21:57:18.313572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.274045Z","title":"You only sample (almost) once: Linear cost self-attention via bernoulli sampling","venue":null,"work_id":"4953f7f8-9798-4b01-8203-4c4033186557","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.786619Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:b15ba2aabb980ebbc0fe1da7a8dec05539b8c094afec0566763140cca83769e4","observation_id":"c6b254d6-566f-4989-907d-8110c0cda514","resolution":{"observed_at":"2026-08-15T21:57:18.281126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.252266Z","title":"A transformer-based framework for multivariate time series representation learning","venue":null,"work_id":"21296fba-8bc9-411d-b2fe-5c6d1c13b533","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.792609Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:f267af461b044943164a87df55c28b9d4969b69441e40ddc952585ed31c7ba84","observation_id":"9930ea55-8a4c-49cc-a0c8-c80a651038ba","resolution":{"observed_at":"2026-08-15T21:57:18.258553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.228634Z","title":"Informer: Beyond efficient transformer for long se- quence time-series forecasting","venue":null,"work_id":"47fef9fc-d4c4-4af3-b9e1-932d6f70b07d","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.801376Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:feff1a7a5088eea204b151f5abdaccd8def363c90c4ed642b0e590ba50eac781","observation_id":"08af783d-08fd-4b9b-8303-4f49c01aeed4","resolution":{"observed_at":"2026-08-15T21:57:18.235074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.206665Z","title":"Importantly, this is in- dependent of the specific configurations of the input matrices Z","venue":null,"work_id":"231e76a4-3f3f-4df6-a8d5-1be90af220a5","year":2007},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.808474Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:fddf14f1cbe07db6ceb21f5cd830601c11a75005db67fd51151787004263c836","observation_id":"474ddc33-cc1b-4846-b1be-30f1f6df8cb3","resolution":{"observed_at":"2026-08-15T21:57:18.213508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.186300Z","title":null,"venue":null,"work_id":"7df478b6-3e77-4a4c-8498-de47e131187c","year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.815280Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:2b321613a9bf8c51ebc3d9f2b0ed7b91fdc586c7b26e4a9e5b2836af6f31443b","observation_id":"38a541d1-5026-4b38-9014-46d75e7fc07d","resolution":{"observed_at":"2026-08-15T21:57:18.193111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00075","last_updated":"2018-10-31T19:24:20Z","snapshot_observed_at":"2026-08-14T18:06:06.742147Z","submitted_at":"2018-10-31T19:24:20Z","title":"The UEA multivariate time series classification archive, 2018","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00075","snapshot_observed_at":"2026-08-15T21:57:17.518238Z","title":"The uea multivari- ate time series classification archive, 2018.arXiv preprint arXiv:1811.00075,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":1985,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.518238Z"},"links":{"cited_paper":"/paper/1811.00075","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:2bf0b6b115bf1e7d3cb963e2f03dc26d717894b25e3f3b8b82ecc7f2aba731ab","observation_id":"0aa60129-3f56-42a3-a1aa-5a153a5f2cc2","resolution":{"observed_at":"2026-08-15T21:57:17.518238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06028","last_updated":"2018-04-17T03:26:28Z","snapshot_observed_at":"2026-08-14T19:25:16.289226Z","submitted_at":"2018-04-17T03:26:28Z","title":"ListOps: A Diagnostic Dataset for Latent Tree Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06028","snapshot_observed_at":"2026-08-15T21:57:17.654832Z","title":"Listops: A diagnostic dataset for latent tree learning.arXiv preprint arXiv:1804.06028,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.654832Z"},"links":{"cited_paper":"/paper/1804.06028","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:639ad53d9eab4771f9321e1166fef474c192456b86ee939cb3f6d981a0d58c5a","observation_id":"94e0fe1b-b746-4fa5-b1a1-0ce2f0cff237","resolution":{"observed_at":"2026-08-15T21:57:17.654832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-15T21:57:17.740134Z","title":"Linformer: Self-attention with linear complexity.arXiv preprint arXiv:2006.04768,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.740134Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:6269e34466bd6b34740e057ff791f8fac1ac536414a137af1589fb5481af35a1","observation_id":"a1ab532b-6abf-4e5d-8530-23ac5a81d6ea","resolution":{"observed_at":"2026-08-15T21:57:17.740134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.865552Z","title":"BERT: Pre-training of deep bidirectional transformers for language understand- ing","venue":null,"work_id":"c2896d46-151a-47a9-b5dd-da803fedc74e","year":2019},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.569525Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:15fb6c2722d44684290c9ff9f72ca046d43ffb0a16f0a8e320388aee09a9c123","observation_id":"07a3f415-4fe4-438f-8b6e-496d04a081ff","resolution":{"observed_at":"2026-08-15T21:57:18.871049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.689523Z","title":"Signal processing on directed graphs: The role of edge directionality when processing and learning from network data.IEEE Signal Processing Magazine, 37(6),","venue":null,"work_id":"7c37e459-1573-4b52-a347-860a1e7cc9b5","year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.637867Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:ddc740629674e2e6eade6ea3eda51eb3ea54b734b44e0d4f2fce943d6579ecb7","observation_id":"2e8e026f-9cfb-49c8-8b4d-6eed759606fa","resolution":{"observed_at":"2026-08-15T21:57:18.695919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:17.686681Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.686681Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:33dab07fec8d574c6dab969b0e4f0797ebda896a93891aa2a66a4f8081225923","observation_id":"0288760a-72f6-41b6-a934-3ea2fbfd5ee0","resolution":{"observed_at":"2026-08-15T21:57:17.686681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.500674Z","title":"Efficient attention: Attention with linear complexities","venue":null,"work_id":"80bcff94-3959-497b-99a6-78a86db15f33","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.707692Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:ecb00beed3b73ffc0ca4d1e174c780d9da9c92867d9286198f0b5622cebc4e8c","observation_id":"5a919ddf-7af8-47de-b892-4e9608d15f1e","resolution":{"observed_at":"2026-08-15T21:57:18.508684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.883172Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"041ef61b-9d88-4fb8-9fda-7d79523bbb0f","year":2009},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.564792Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:f1c59d8407989a0495e0682b03af27ef9c720779353821e0246158d548e55b0e","observation_id":"5adb96c1-77e1-4afa-a945-c3da390543f9","resolution":{"observed_at":"2026-08-15T21:57:18.889059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-15T21:57:17.600087Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.600087Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:e57a35b1e6c08aae07797412687033435ac93fe550e0b55fd48309407b45cf07","observation_id":"4166ad2f-b72b-46a6-b00e-df4ccaa47f28","resolution":{"observed_at":"2026-08-15T21:57:17.600087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-15T21:57:17.524155Z","title":"Longformer: The long-document trans- former.arXiv preprint arXiv:2004.05150,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.524155Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:46713aaf0f778684f56d73b5b3ff7cbd1466663f932317b426f36b98f0f58e60","observation_id":"1c65d0e3-6059-4ea6-bbb5-b5b40eded560","resolution":{"observed_at":"2026-08-15T21:57:17.524155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.925952Z","title":"Graph convolutions enrich the self- attention in transformers!Advances in Neural Information Processing Systems, 37:52891–52936,","venue":null,"work_id":"075b4642-d264-4061-8bc1-e24fec022e91","year":2024},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.547189Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:9b85cbc377888dc5fa58bd34d0351b812b1988d9e64ff83b969a6283ad1c1917","observation_id":"02ea353b-7927-4cb4-aaef-ca2aa22fe9e7","resolution":{"observed_at":"2026-08-15T21:57:18.931728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19798","last_updated":"2023-12-05T09:26:05Z","snapshot_observed_at":"2026-08-16T07:35:10.801625Z","submitted_at":"2023-05-31T12:38:24Z","title":"Primal-Attention: Self-attention through Asymmetric Kernel SVD in Primal Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19798","snapshot_observed_at":"2026-08-15T21:57:17.529938Z","title":"Primal-attention: Self- attention through asymmetric kernel svd in primal repre- sentation.arXiv preprint arXiv:2305.19798,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.529938Z"},"links":{"cited_paper":"/paper/2305.19798","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:da847e9a7788b731b91ba186e9e2174cfb6fe96efbfc36cbfc8f5011c5ae4d76","observation_id":"271432c3-c57f-4161-a567-3c2122f6c1fc","resolution":{"observed_at":"2026-08-15T21:57:17.529938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-15T21:57:17.541068Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.541068Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:b90d983b5e2bbd4b642c5f805290127000821c391bb49bcb52cc5bd72353fe8c","observation_id":"eafc4907-35d5-41e1-8f82-1504c0bc5829","resolution":{"observed_at":"2026-08-15T21:57:17.541068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.588719Z","title":"The acl anthology network corpus.Language Resources and Eval- uation, 47,","venue":null,"work_id":"24246057-1adf-4f2c-994d-575a7d8dca10","year":2013},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.681605Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:4284bc8eb84572ce4af7be6f7b43a8a603c6e2562a59aafe88518d0a1cd9b441","observation_id":"13814adf-9869-4806-9f79-39cef4bc6a1e","resolution":{"observed_at":"2026-08-15T21:57:18.595200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:57:18.944445Z","title":"Adaptive universal generalized PageR- ank graph neural network","venue":null,"work_id":"9f67945d-b31b-4d1c-8b36-3144e742f12d","year":2021},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.535662Z"},"links":{"citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:0d633340ea4608bb0f68666d0b5dad5e53b772be2ad6e0cf242b231f1e4bbc2e","observation_id":"4ab34d8d-5536-4c88-b730-b5ec93f9b37b","resolution":{"observed_at":"2026-08-15T21:57:18.950086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-15T21:57:17.553443Z","title":"Rethinking attention with performers.arXiv preprint arXiv:2009.14794,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T21:57:17.553443Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2505.08516"},"observation_digest":"sha256:9fe8286a897473652a4a681a84c6a5e380b0c7b1f68386db64d49c204ae5443d","observation_id":"09c922d4-6f84-4a4e-aa82-9b85a91e96c4","resolution":{"observed_at":"2026-08-15T21:57:17.553443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.08516","last_updated":"2025-05-13T12:48:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T07:35:22.957707Z","submitted_at":"2025-05-13T12:48:04Z","title":"Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2505.08516."}