{"as_of":"2026-08-16T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a357ade01c0217512bb7945bb31a3443578be66973aa773cb694b0c944950d3","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:44:39.644854Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.03214/citation-record","integrity":"/paper/2412.03214/integrity","json":"/paper/2412.03214/citation-record.json","paper":"/paper/2412.03214"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:37.560811Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.560811Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:77a479c69642a70c2f1c7933766a98cbdc2f9be6e512ff158b0d78dfb8c103fb","observation_id":"83a7882d-d623-4b10-a68b-fc7d063bb216","resolution":{"observed_at":"2026-08-11T22:44:37.560811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.107421Z","title":"Trans- formers in the real world: A survey on NLP applications","venue":null,"work_id":"106853b5-3c5a-41ba-9b66-58761efe2b2e","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.585313Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:b8b4299f38a9aae6eff6e8da217ef94b23da6be27946be96af1f37bfc4223887","observation_id":"d9e8ee95-a755-45e8-b082-363e52dccca1","resolution":{"observed_at":"2026-08-11T22:44:42.116252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.090548Z","title":"Transformer architecture and attention mechanisms in genome data analysis: A comprehensive review","venue":null,"work_id":"73efb55e-3db4-4acb-a756-8cc53601d6b6","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.608725Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:41331443265fe5819d62519819fdcb37accf7dd28c1b8a12716ffea7e6901d97","observation_id":"309c28f1-4373-43ca-88e0-f0413ab061a8","resolution":{"observed_at":"2026-08-11T22:44:42.095133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05700","last_updated":"2022-09-13T02:57:05Z","snapshot_observed_at":"2026-08-13T14:28:09.314646Z","submitted_at":"2022-09-13T02:57:05Z","title":"Vision Transformers for Action Recognition: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05700","snapshot_observed_at":"2026-08-11T22:44:37.631872Z","title":"Vision transformers for action recognition: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.631872Z"},"links":{"cited_paper":"/paper/2209.05700","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:18265177f44887e3d70572ef1fe35c007e90f1c4faac1841c4af451bda6172e6","observation_id":"cdbf2adc-389f-42ae-ae75-7c64cbf05300","resolution":{"observed_at":"2026-08-11T22:44:37.631872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:37.658027Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.658027Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:b0140b2f3c82912f0b7acf71adef9466c35dbf55368673c7eec3191c209d935b","observation_id":"7c031925-eda3-4cab-a169-f101a01fca84","resolution":{"observed_at":"2026-08-11T22:44:37.658027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.059635Z","title":"Singh, Muskaan Chopra, Sudhakar Kumar, and Francesco Colace","venue":null,"work_id":"9203269e-d68e-48d4-b58a-b3a413e0222a","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.665357Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:e2894ef2fbe1a354b37e7799928235f1f5f49bc2b194099b3645e575a07cff16","observation_id":"08f7b4d3-2a99-4f6c-8ad6-3359775363da","resolution":{"observed_at":"2026-08-11T22:44:42.064666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:42.017185Z","title":null,"venue":null,"work_id":"a8d3de24-1c13-4494-bb51-c9935ffc9491","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.672574Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:0b94294d451c959fd1e816916f253ace1bb6eebe5a4d5fdc54d9b0ef64852e91","observation_id":"8dcf52df-da94-4a1a-bbe6-8c7341c60f5e","resolution":{"observed_at":"2026-08-11T22:44:42.046836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13912","last_updated":"2024-01-25T03:14:07Z","snapshot_observed_at":"2026-08-15T19:35:05.560807Z","submitted_at":"2024-01-25T03:14:07Z","title":"A Survey of Deep Learning and Foundation Models for Time Series Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13912","snapshot_observed_at":"2026-08-11T22:44:37.678717Z","title":"Miller, Mohammed Aldosari, Farah Saeed, Nasid Habib Barna, Subas Rana, Ismailcem Budak Arpinar, and Ninghao Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.678717Z"},"links":{"cited_paper":"/paper/2401.13912","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:ba27c28ebd03f1e71b7e4af3b83554250c78049765985d4c42e679dc7c18a9d1","observation_id":"c633bb72-ae33-4ffb-acac-0e1585a0e699","resolution":{"observed_at":"2026-08-11T22:44:37.678717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.930974Z","title":"Single-layer Vision Transformers for more accurate early exits with less overhead","venue":null,"work_id":"4095b6e0-81b7-496d-bf6e-3b3e7666cb45","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.687415Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:2620eb47ea6e26e3c213c832e5680d583c3c8d7fd9446a7233f52316c54d8d9f","observation_id":"1320ca10-055f-4a0d-93b5-a468a428c8e5","resolution":{"observed_at":"2026-08-11T22:44:41.957365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.878321Z","title":"Efficient High-Resolution Deep Learning: A Survey","venue":null,"work_id":"c432de70-73c7-46fb-b51d-18a38fca32de","year":2024},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.693455Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:a06f3d489f5a31287153410757084356ba7ed6ef8dc31bca90961e743f7d7a9b","observation_id":"21a2c198-fe2b-4800-a2fa-e56f3f188726","resolution":{"observed_at":"2026-08-11T22:44:41.914753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.772601Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":"ef37c7d4-0f04-498d-af1b-b6f30789c1cf","year":2020},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.709719Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:d6653cc0a3959e1f720e800d62a709c03e6521f9c026eab1c464deb7ab7c9a54","observation_id":"2a48665e-950a-4eaa-b1ee-1195e1c47984","resolution":{"observed_at":"2026-08-11T22:44:41.798661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00230","last_updated":"2024-03-07T10:25:20Z","snapshot_observed_at":"2026-08-13T04:51:07.664724Z","submitted_at":"2023-12-30T13:44:23Z","title":"Transformer Multivariate Forecasting: Less is More?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00230","snapshot_observed_at":"2026-08-11T22:44:37.741777Z","title":"Transformer multivariate forecasting: Less is more? arXiv:2401.00230, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.741777Z"},"links":{"cited_paper":"/paper/2401.00230","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:312a08f28f1e93d3a0731e5b24afc9c242a496342e01ea2abb84bc556aa5be5c","observation_id":"47b7b396-2cc8-4173-9b52-834147af03f7","resolution":{"observed_at":"2026-08-11T22:44:37.741777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.743906Z","title":"Informer: Beyond efficient transformer for long sequence time-series forecasting","venue":null,"work_id":"caa2a3cb-5dea-470b-9df4-43c351b3ca1a","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.784016Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:9b5f0608f22a873030a211508e9fbd0a577e0b3f856cadc415bb04308c31cfb3","observation_id":"1381d7d6-c38f-4296-9cbf-46b3f1961653","resolution":{"observed_at":"2026-08-11T22:44:41.757602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-11T22:44:37.824736Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.824736Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:5e256b471f523a0260dc5cc87f0e142cc0a91653e27961d7dc1436ac385befe1","observation_id":"30e07cca-337d-4c57-95b1-2a9e25c3d1d0","resolution":{"observed_at":"2026-08-11T22:44:37.824736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T22:44:37.885666Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.885666Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:ab997f5b3c1e1e4211712c010f4cbfb6629ae21d5435e708d5b41db2a63f994d","observation_id":"657ca656-b3a5-445c-b4b0-a702e519e3b8","resolution":{"observed_at":"2026-08-11T22:44:37.885666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.716628Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":"e9c42973-b106-474b-b7c1-13ca43a50118","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:37.926721Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:4f3e8299dea805113b4898a824cf7098408f87836f9ac1ff2b137b970b931292","observation_id":"18ed6feb-b2d0-4764-a462-022723270451","resolution":{"observed_at":"2026-08-11T22:44:41.722643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.656491Z","title":null,"venue":null,"work_id":"f410c0d7-31ae-4a76-aca7-41b2cece61ce","year":2005},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.004831Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:435467e56cc9217c04708d38dd0d705d0105d2a00593ce0fe1ec224d8492f6ad","observation_id":"33154db5-73dc-4163-be7d-057b180bb6fc","resolution":{"observed_at":"2026-08-11T22:44:41.691539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.546871Z","title":"On compressing deep models by low rank and sparse decomposition","venue":null,"work_id":"d8302ec8-d732-4141-9ac7-722765377566","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.074819Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:9713e6258a63ef70edda279e9e347a21251f9cb85752cef66795d158ad94e6e6","observation_id":"0c206191-9b08-4ce4-9273-d89ee9b659bd","resolution":{"observed_at":"2026-08-11T22:44:41.619889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.502317Z","title":"Nystr ¨omformer: A nystr ¨om- based algorithm for approximating self-attention","venue":null,"work_id":"51165003-b638-4faa-a117-6258dcd5ec32","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.113281Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:d52b11aed8dccbee1dd9bab066e882da8c8a47d304fd151445efb4dfa1acc0fd","observation_id":"482af051-da69-4fec-8bb6-bcb2d36bc70f","resolution":{"observed_at":"2026-08-11T22:44:41.518206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.486433Z","title":null,"venue":null,"work_id":"ea8350c4-2fa8-4a2c-9ac9-6068f7f61479","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.152983Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:4fe5433e1bb1a77845e21c5324f707877d91d87fa480295dc42217693a12185d","observation_id":"eb233905-3fc3-4df1-8bd8-3d133d3b2ae4","resolution":{"observed_at":"2026-08-11T22:44:41.491454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.414975Z","title":"Cvt: Introducing convolutions to vision transformers","venue":null,"work_id":"c03b76d8-7a8b-49d8-a495-bd005e855065","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.187980Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:5e9ea79b21bbecfc709228ca6c1936837594019b0fb16ac0821099d205fc446e","observation_id":"7fec859d-ce3d-4cd7-a76e-129963bb2511","resolution":{"observed_at":"2026-08-11T22:44:41.438242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.354747Z","title":"Khan, Muzammal Naseer, Munawar Hayat, Syed Waqas Zamir, Fahad Shahbaz Khan, and Mubarak Shah","venue":null,"work_id":"0b0ac7d9-6703-41e5-9883-218e32e4ac09","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.233332Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:65dbced4de5a48c8160e0c0dfef8d259689061be37f7679d880bb3e25f7c2256","observation_id":"8f04936d-ae7b-4c44-ab1c-581c45bfba35","resolution":{"observed_at":"2026-08-11T22:44:41.400138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.210578Z","title":"Is space-time attention all you need for video understanding? In International Conference on Machine Learning , pages 813–824, 2021","venue":null,"work_id":"bff9eb11-fc40-47ed-87bc-5a34f47607aa","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.261477Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:ab97fda282efd1ef5bab2e1802d667fbc3d3cd5c30851af5417f65c63fa0eaf0","observation_id":"9325c7c2-9068-4b8a-8a04-e45a2970a68a","resolution":{"observed_at":"2026-08-11T22:44:41.229959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.147928Z","title":"Video swin transformer","venue":null,"work_id":"cd2bdd1e-c7ff-4b48-94dc-616de704f487","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.271563Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:a18358636c86b2a13ab0782b1693a905d559567aa4a5ade4f0ae9840189ce883","observation_id":"244c4f92-1030-4139-a755-de2cbb375f73","resolution":{"observed_at":"2026-08-11T22:44:41.159513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.064793Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"16cf5755-84cc-4bdf-813a-3be2d1eddaad","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.278243Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:b921037e22d2fb0958756da094a49b0c4deca9908c58bb90be7efa29735f236c","observation_id":"cf1ba3af-7d2f-4c83-aacd-caffe87114eb","resolution":{"observed_at":"2026-08-11T22:44:41.073936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:41.004904Z","title":"Multiscale vision transformers","venue":null,"work_id":"16e7ab3c-3b5b-4ab6-94cb-00a3e4be7fba","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.288171Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:e14c3da54bd644328ae4f827fb41f82972c803c2a384808903003f7955b3b77a","observation_id":"9dc1b33e-e954-4c81-9d43-c3e96c4862ba","resolution":{"observed_at":"2026-08-11T22:44:41.039577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.836055Z","title":"Continual inference: A library for efficient online inference with deep neural networks in pytorch","venue":null,"work_id":"db51c297-12bb-4c8b-a1db-26349f3b47da","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.297757Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:4fdbfb807b1462279c2855287622edc0e1e6a1be62df45dc604bd2e656bf2250","observation_id":"e85fd8f0-7c47-4960-875d-f2e66f881132","resolution":{"observed_at":"2026-08-11T22:44:40.874754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05911","last_updated":"2019-11-23T06:36:13Z","snapshot_observed_at":"2026-08-10T18:23:52.033853Z","submitted_at":"2019-11-23T06:36:13Z","title":"Recurrent Neural Networks (RNNs): A gentle Introduction and Overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05911","snapshot_observed_at":"2026-08-11T22:44:38.334752Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.334752Z"},"links":{"cited_paper":"/paper/1912.05911","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:7cc1b0f61fba41c5e82f56a84a14924d9907501296e93b66eecc63fde4a570ce","observation_id":"441c2d58-0a39-4922-b48e-94bf01d15d6b","resolution":{"observed_at":"2026-08-11T22:44:38.334752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.03314","last_updated":"2023-07-31T00:06:04Z","snapshot_observed_at":"2026-08-15T06:55:15.143623Z","submitted_at":"2018-08-09T19:31:42Z","title":"Fundamentals of Recurrent Neural Network (RNN) and Long Short-Term Memory (LSTM) Network","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.03314","snapshot_observed_at":"2026-08-11T22:44:38.424754Z","title":"Fundamentals of recurrent neural network (RNN) and long short-term memory (LSTM) network","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.424754Z"},"links":{"cited_paper":"/paper/1808.03314","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:a97d0df19a1bcbf08944aabfb042eb71826d4046fad0a9e30547c89d7718b7c3","observation_id":"b0d4dba8-0bcf-44ad-a636-4c1860f81a45","resolution":{"observed_at":"2026-08-11T22:44:38.424754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-11T22:44:38.496915Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.496915Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:f91ed0c1e81a7f595cc4acd54af8795565cf4306191208f4772938823df36cfa","observation_id":"2044053f-ad31-4bb8-8800-96f6f7ac2bfb","resolution":{"observed_at":"2026-08-11T22:44:38.496915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.771888Z","title":"Con- tinual transformers: Redundancy-free attention for online inference","venue":null,"work_id":"881f77b6-afd0-438c-821a-2d5725512217","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.574754Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:fea6eb6c9193d1bc8c1f62a804994bc9ed4303de5e6795dd080fe22eef930ef7","observation_id":"d264e9e3-0d8e-4735-8b9a-3f2a6a9d6d70","resolution":{"observed_at":"2026-08-11T22:44:40.788814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.750678Z","title":"Continual spatio-temporal graph convolutional networks","venue":null,"work_id":"b7e54ae2-3dcd-49f8-a9a0-375a912c0164","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.654762Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:c72e988f1ad61f5f694047cb8382e72490de5c31e8eefeb31a4f0bcd52d1d7ec","observation_id":"b0f1d5b5-ebc6-414a-b48f-f7ce3bf69179","resolution":{"observed_at":"2026-08-11T22:44:40.757538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.722067Z","title":"Continual 3d convolutional neural networks for real-time processing of videos","venue":null,"work_id":"f2c97fbc-fdda-4204-ae50-d0d29f11fcda","year":2022},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.676956Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:816e447a6677732579f7ee2729e19084e0f48896d89b4d1c396500b664f91a8f","observation_id":"8d2f63dd-9cd7-4759-a86b-49399ca1f81d","resolution":{"observed_at":"2026-08-11T22:44:40.728866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02239","last_updated":"2021-10-01T15:08:54Z","snapshot_observed_at":"2026-08-13T18:51:46.469705Z","submitted_at":"2021-07-05T19:24:23Z","title":"Vision Xformers: Efficient Attention for Image Classification","version":4},"cited_work":{"arxiv_id":"2107.02239","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.02239","snapshot_observed_at":"2026-08-11T22:44:39.792276Z","title":"Vision Xformers: Efficient Attention for Image Classification","venue":"cs.CV","work_id":"c519ae82-9dca-4dcd-91fc-17e3dcf9c371","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.692313Z"},"links":{"cited_paper":"/paper/2107.02239","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:d1ab96f10dddc5eb2b1eae127eb149e82d6c1d28689f94c8b827ffebfa7b483a","observation_id":"8a4844b2-ca53-42ac-b7e9-81674a1eab92","resolution":{"observed_at":"2026-08-11T22:44:39.810327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.699666Z","title":null,"venue":null,"work_id":"b8e09968-f3af-429b-894c-363f86293102","year":2001},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.711690Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:28b3df753f8e64bee227c65dba69b9754ce6e1eb88ffdc10e154e7506d5176f4","observation_id":"df2aa885-c7d9-4d02-b71f-dd91d41e02d2","resolution":{"observed_at":"2026-08-11T22:44:40.704544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.649245Z","title":"Improving CUR matrix decomposition and the nystr ¨om approximation via adaptive sampling","venue":null,"work_id":"ea878b32-9ee3-4eb9-a7b3-086e499e53cc","year":2013},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.730191Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:41d4396a6d2cdc0532e6e89d4a5d3e1f29a396ca6ff8b871f4cc58b385b8c166","observation_id":"bd29012b-19ed-4aa8-9190-82c481547247","resolution":{"observed_at":"2026-08-11T22:44:40.664219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.604752Z","title":"Asano, Ishan Misra, Florian Metze, Christoph Feichtenhofer, Andrea Vedaldi, and Jo˜ao F","venue":null,"work_id":"3f753802-8e5a-4e5a-9dc5-a800553427e5","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.747057Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:c70ad762ca62d09c81a4540cf4a4f1a5368bc7f9c4bf7eaef4256ed54033e014","observation_id":"45102145-f9a7-42e6-9079-5fad17f40a35","resolution":{"observed_at":"2026-08-11T22:44:40.634763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.560797Z","title":"Eventful transformers: Leveraging temporal redundancy in vision transformers","venue":null,"work_id":"78453fca-7839-4c6c-8b5b-2974d8ab9aee","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.763874Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:9769508ab199c1df5978c6350476fed52ef4fadd7ed2549195f5f4d354fb4a7e","observation_id":"620357d3-163d-4eb3-a11f-f13997d261b3","resolution":{"observed_at":"2026-08-11T22:44:40.573467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.544752Z","title":"SOFT: softmax-free transformer with linear complexity","venue":null,"work_id":"786bb471-a543-4905-9252-fea760b7d9a0","year":2021},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.776102Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:492984069c7e3afcb220378dd9b2676f4f8ebb784ed4cceee35b1b1c343d0e77","observation_id":"480e11bc-f926-4ba9-a14d-ba55add0535f","resolution":{"observed_at":"2026-08-11T22:44:40.549808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.521954Z","title":"Adaptive multi-resolution attention with linear complexity","venue":null,"work_id":"b19f4ec1-e3d2-421b-84ce-2904540bcd05","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.786218Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:9feaa11fcb7ba0d6b2cc956b5faa9ccb05aa107d0cbf09c6736dc64387cc2881","observation_id":"9bde083f-78fd-4cf1-b7fd-a96e666e84c3","resolution":{"observed_at":"2026-08-11T22:44:40.526966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.500069Z","title":"Kwok, Slobodan Vucetic, and Bahram Parvin","venue":null,"work_id":"9c3eed30-4a04-4e99-95f1-de150b872114","year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.806535Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:e24a43dbe4dba2de2f0e11c2036cb494ad99d967ac5ce06790ec81a1d0879f28","observation_id":"14bcae77-5745-44ec-aa1a-0621c15731f8","resolution":{"observed_at":"2026-08-11T22:44:40.504483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.485637Z","title":"Scaling Up Class-Specific Kernel Discriminant Analysis for Large-Scale Face Verification","venue":null,"work_id":"7fdcbdff-9a92-40a2-8e3b-24e47f7d2a13","year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.830629Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:eb4c6b117d15b64a708308f34d3179ee9d527d18f534513bfa83265849141684","observation_id":"2187b7f2-73f8-41c2-92d7-025cd52f77b3","resolution":{"observed_at":"2026-08-11T22:44:40.490992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.463955Z","title":null,"venue":null,"work_id":"829559a3-2276-48d1-ad03-f8c5f915c4b2","year":2010},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.847533Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:df0179b5219e4ff2477cc5661b90d6417c8094f56f12022132ff524bafca4f75","observation_id":"713ab673-31da-436a-9487-5088d642b9c8","resolution":{"observed_at":"2026-08-11T22:44:40.468909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.425916Z","title":"Razavi, A","venue":null,"work_id":"f0920b0d-638b-450b-8816-6b854b32fe9e","year":2014},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:38.918263Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:26382441004718f29a3e00aa149f482931aac971c6f8752e1bdeddf06421268a","observation_id":"966c9101-4ecb-47bf-9b51-f5114dfed757","resolution":{"observed_at":"2026-08-11T22:44:40.444590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.406616Z","title":"Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala","venue":null,"work_id":"5b1e9cd7-b3b9-461c-bcd9-42a9d9866c76","year":2019},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.002918Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:c530baeccd54a65e2c145f9f5a77d01819ab49331621adc62dc910fa86881295","observation_id":"1ce32579-6c34-40c5-853d-c2b6589cac75","resolution":{"observed_at":"2026-08-11T22:44:40.411820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:39.077024Z","title":"Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.077024Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:da6d74f40775eaf104197466e33721ce99094c2ada591795b5bf1f8884aa0470","observation_id":"3f276387-f333-4237-8a4f-81244191b6fd","resolution":{"observed_at":"2026-08-11T22:44:39.077024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.369093Z","title":"A scale for the measurement of the psychological magnitude pitch","venue":null,"work_id":"bd7d5042-19d6-4fd2-b784-fe3991d0fbbb","year":1937},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.114723Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:bdd406944cabf73d812a17b9c0b3863dc1c702d6fbb03db3b4f50f06714ed04b","observation_id":"89eb0dd3-f32d-46b6-bfba-9a2b66c8a1fb","resolution":{"observed_at":"2026-08-11T22:44:40.373758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.351735Z","title":null,"venue":null,"work_id":"52207d1c-577e-4e09-b6ec-2e277afb044b","year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.136926Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:1c86442c7eb58b24fabb12c4603477f8c21942b8b53ce49238cda2aa0c38016e","observation_id":"2b540d7a-cd01-4458-bbf1-a159ad915c63","resolution":{"observed_at":"2026-08-11T22:44:40.357671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.11154","last_updated":"2020-11-13T19:09:09Z","snapshot_observed_at":"2026-08-13T10:14:31.550038Z","submitted_at":"2020-07-22T01:31:44Z","title":"Rethinking CNN Models for Audio Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.11154","snapshot_observed_at":"2026-08-11T22:44:39.145701Z","title":"Rethinking CNN models for audio classification","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.145701Z"},"links":{"cited_paper":"/paper/2007.11154","citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:14438569d3336f7230e8d8f4336e21bc0738bce3e0d4d00d9ca4eb2674172e82","observation_id":"246b5cb2-cd41-4610-80b0-526f39841219","resolution":{"observed_at":"2026-08-11T22:44:39.145701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.329524Z","title":null,"venue":null,"work_id":"b1015568-a38c-455b-a948-5309e4dc222a","year":2002},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.158420Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:8b2a9062ff750002a6a0ed20155d48d7685104b90f0e9a8cb1033ac6101c1c8b","observation_id":"b45f7573-7419-4ec0-b994-4f31ada548cd","resolution":{"observed_at":"2026-08-11T22:44:40.338794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:39.194753Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.194753Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:75902fe3a0ef720c56c891a13ebdd031d6e7a8fe3c959d6c5f477e76cd47688b","observation_id":"ce5d047b-73b8-477f-8287-a4cd9120388c","resolution":{"observed_at":"2026-08-11T22:44:39.194753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.293114Z","title":null,"venue":null,"work_id":"76de4047-4155-410c-ad2e-6fc1bca742ef","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.244752Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:15726a8770a51acf647a95a6247e98c6e237a69bd0e27e0a5508a32e1873df16","observation_id":"8ea7da11-24b8-41ff-8603-654785156cf4","resolution":{"observed_at":"2026-08-11T22:44:40.298730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.274355Z","title":"Online action detection","venue":null,"work_id":"5012fc87-6d45-403c-87eb-fd21fa11679c","year":2016},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.295397Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:c5d795e83ef629f3360a66ec8a24383a55409e3e1c79d1fb3f915827e39edf68","observation_id":"aa2b296a-426a-4a16-b7ac-524fce1674db","resolution":{"observed_at":"2026-08-11T22:44:40.281898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.243071Z","title":"Zamir, Yu-Gang Jiang, Alex Gorban, Ivan Laptev, Rahul Sukthankar, and Mubarak Shah","venue":null,"work_id":"009d9aa1-ecc3-41b0-9a41-c2bb627d10fe","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.354753Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:e4a81e1486e7206c0ba1de218c7cfd8cbe4bbc192341c470c001dd600908f8b7","observation_id":"3f8c1463-21a2-4cb9-a3c2-33e8f22e3d3d","resolution":{"observed_at":"2026-08-11T22:44:40.261641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.225496Z","title":"Learning to discriminate information for online action detection: Analysis and application","venue":null,"work_id":"bbcb46e4-310e-452b-86a8-86c3f9045934","year":2023},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.404751Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:6dc2c3bd1c420066133f50a6dddf0c1e2ba36be26fdf05be46ee15dd8d100eeb","observation_id":"d644c828-e7e8-4883-a254-386ce7b32b06","resolution":{"observed_at":"2026-08-11T22:44:40.232066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.193266Z","title":"Temporal segment networks for action recognition in videos","venue":null,"work_id":"fa3034b2-c05a-40f3-b1ca-3984d98e83a2","year":2019},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.454753Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:611af0022da944f379489a9e7afc957100edd7ad6e82efbb1699b289d9d8ca63","observation_id":"d484079c-0c8a-4fa6-9de2-1ecc11c7a361","resolution":{"observed_at":"2026-08-11T22:44:40.206663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.170813Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"64fc1b56-0fbb-4339-8279-92ce3c48ff0c","year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.494828Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:bfde74268363db47786e1bb0dc7fe0db96f3161045dd50ab718073149b49920e","observation_id":"c2dd5313-df5e-4812-a86a-4496c3463baa","resolution":{"observed_at":"2026-08-11T22:44:40.178237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.147398Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":"ea18f2a5-3471-44b0-ae3c-ade8878def18","year":2017},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.544754Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:7461fef11aa31390d0abd5c7bbac9559913fc91cae58b55f1bfefca3a67aa514","observation_id":"ddec96f0-c937-4bec-afda-fb7fde1d1809","resolution":{"observed_at":"2026-08-11T22:44:40.156896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:39.594853Z","title":"ElectricityLoadDiagrams20112014","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.594853Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:061e3b923c89d3f115e6b593e9815a2a2b57335e3c097a32fcd10c98456b886b","observation_id":"d1c5ca38-4526-459f-ad8e-fb9378444d07","resolution":{"observed_at":"2026-08-11T22:44:39.594853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:44:40.089663Z","title":"Decoupled weight decay regular- ization","venue":null,"work_id":"ba887493-3ae2-4571-b11b-cee636fb030a","year":2019},"citing_paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:44:39.644854Z"},"links":{"citing_paper":"/paper/2412.03214"},"observation_digest":"sha256:60c73c9ab4e9b44a6f774cc120fd04b0b7a2990814bfcffec56972699dfa1508","observation_id":"d9c4f5a0-173a-4172-9f57-92be4b891bd2","resolution":{"observed_at":"2026-08-11T22:44:40.124750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03214","last_updated":"2025-07-28T10:27:45Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:52:15.748600Z","submitted_at":"2024-12-04T11:05:01Z","title":"Continual Low-Rank Scaled Dot-product Attention"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":37},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2412.03214."}