{"as_of":"2026-08-09T07:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5310666c004253885a33fa5cb20931c01d682b90948ca665dacae0ec8a2dcd25","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:54:36.489014Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.01718/citation-record","integrity":"/paper/2510.01718/integrity","json":"/paper/2510.01718/citation-record.json","paper":"/paper/2510.01718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.229619Z","title":"Croci, Marcelo Gennari do Nascimento, Torsten Hoefler, and James Hensman","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.229619Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:1ba142270f9b8d2f659a0dfb9951984323d70bb0761b939aa78c821d8c9f84ef","observation_id":"73142ff2-4f01-4393-9534-36de299848ad","resolution":{"observed_at":"2026-08-04T12:54:30.229619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-04T12:54:30.269838Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.269838Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:f09ac4a899aad1fb01286c904929185a6efbe809768f46c547754bc7c961d518","observation_id":"640eeb3a-151f-454f-9f2f-4da6f2fa88f4","resolution":{"observed_at":"2026-08-04T12:54:30.269838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-04T12:54:30.322033Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.322033Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:978d52dc3dfd3a45e5d1017df75c01dbde04254bfa81e6da5e6f6de8c58bd77a","observation_id":"a7045ed7-be93-4994-92ba-59ddb6e45bc7","resolution":{"observed_at":"2026-08-04T12:54:30.322033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.370688Z","title":"Linear least squares solutions by householder transformations","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.370688Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:6ccfa3e1dfaa3d58b451e729bc23dcde7934d8d9c5ed1352f379a6ba9e6cc3e2","observation_id":"00d8f182-ab52-47d9-8058-734c395a446f","resolution":{"observed_at":"2026-08-04T12:54:30.370688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.457634Z","title":"u ker, Luisa Bentivogli, and Marcello Federico. Report on the 11th IWSLT evaluation campaign. In Marcello Federico, Sebastian St \\","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.457634Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:625ca48fb3f8a8214b5ffc56155dc3cd5dc135a743952774d1fe620319577fca","observation_id":"5a81a44c-5501-4bb1-a19d-95d6a2fb30ee","resolution":{"observed_at":"2026-08-04T12:54:30.457634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T05:01:32.757930Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-04T12:54:30.547368Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.547368Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:49c0d5f3b0d5373f97c20fe45c4319b12d2088e00d4d3d2103433a1e2688a299","observation_id":"5af29c4f-d56f-4c78-ac2c-3a8c2f8f77cb","resolution":{"observed_at":"2026-08-04T12:54:30.547368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.602091Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.602091Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:828436ed348f99f9462517ccc6bf7c19ad30ceab8c87aa66a2beddf48557955a","observation_id":"cce563b0-900f-4561-a90d-b07ee1fdde09","resolution":{"observed_at":"2026-08-04T12:54:30.602091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-04T12:54:30.663535Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.663535Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a50a9edab884c3676757253f4e3a689e17e4373ec455da9d31f9f805392b484b","observation_id":"20be47fb-d94d-4b85-8eb5-9b30cf963f76","resolution":{"observed_at":"2026-08-04T12:54:30.663535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.706584Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.706584Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:b2555015ac200bb8340d8f40fb822c53d7f548e87cb45d3b613868077a8ba81f","observation_id":"21a61534-ad57-4eeb-a424-c151aadd6afb","resolution":{"observed_at":"2026-08-04T12:54:30.706584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.763214Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.763214Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:370952256eace6798d1f81338fadd0bf5ae005b3d3994733d5723203076d2f20","observation_id":"b6941ade-a66e-46b3-b115-1816909e2f36","resolution":{"observed_at":"2026-08-04T12:54:30.763214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.802792Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.802792Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:361f1e36fbd87a662eac879b6fc794b5574b75a08091f7bfa366843c6a9f12a7","observation_id":"a2bba1f1-1e01-4127-83a6-4f2bc1d452d3","resolution":{"observed_at":"2026-08-04T12:54:30.802792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.824068Z","title":"OPTQ : Accurate quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.824068Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:0e1e117324e1b2a73ebe56a02a6084934bfe752b5033cea202a7d94da25c1fa2","observation_id":"6010a440-46a5-4e74-89ff-412c8e4fa407","resolution":{"observed_at":"2026-08-04T12:54:30.824068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.865017Z","title":"Strategies for applying low rank decomposition to transformer-based models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.865017Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:3f293111a5bd605b4a2a1c2fa61cf98f5462f3551be94cd21a6aa258a3f967cf","observation_id":"5a9db1f6-3352-4f02-9ef6-f5ca335451d4","resolution":{"observed_at":"2026-08-04T12:54:30.865017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.910134Z","title":"SLTrain : a sparse plus low-rank approach for parameter and memory efficient pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.910134Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:5c7b5f00578d0eb14842ec2f7f740688f6d983709b9a37d4c0578aebbec02257","observation_id":"a057aba3-d32e-4e15-9bf0-b17222eaee1d","resolution":{"observed_at":"2026-08-04T12:54:30.910134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:30.931321Z","title":"Language model compression with weighted low-rank factorization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:30.931321Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:18c5fc5d10106254771b4c136c1f077666843fd16a9b057d946dc1981ff618e0","observation_id":"be4e18b6-074b-42af-9377-38971a8d2709","resolution":{"observed_at":"2026-08-04T12:54:30.931321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.029756Z","title":"Lo RA : Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.029756Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:554bb6df1def89aecef60971ee39cb8032b25ec56ebd5ff2f4e10c0fa24af3aa","observation_id":"2a63d98f-6da0-464d-9196-37cc203100a1","resolution":{"observed_at":"2026-08-04T12:54:31.029756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11239","last_updated":"2025-06-07T06:59:36Z","snapshot_observed_at":"2026-08-04T13:43:35.284914Z","submitted_at":"2024-07-15T21:05:20Z","title":"From Low Rank Gradient Subspace Stabilization to Low-Rank Weights: Observations, Theories, and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11239","snapshot_observed_at":"2026-08-04T12:54:31.091978Z","title":"From galore to welore: How low-rank weights non-uniformly emerge from low-rank gradients","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.091978Z"},"links":{"cited_paper":"/paper/2407.11239","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:6811f4c99b8008dc44b8c128493598313b24d32ee66f7d9fddf379fd685ac4ba","observation_id":"2b676826-9b17-4b04-b090-538dc0d1f1d4","resolution":{"observed_at":"2026-08-04T12:54:31.091978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-07T03:29:16.217842Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-04T12:54:31.209617Z","title":"Exploring low rank training of deep neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.209617Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:eb5b602136a82535f4bf309f9f3872e8dfa93058138f1708bf9f555aec6c4ee3","observation_id":"a6a14013-6408-4d60-858d-e52a7e75f9e7","resolution":{"observed_at":"2026-08-04T12:54:31.209617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.333202Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.333202Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:c8bf3167adb69d6936ca726848adda660bee17532d829176580f5c3b2ba9d669","observation_id":"631783ef-d799-40a2-8984-3a39a3333220","resolution":{"observed_at":"2026-08-04T12:54:31.333202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14021","last_updated":"2023-09-25T10:35:17Z","snapshot_observed_at":"2026-08-07T11:20:14.506370Z","submitted_at":"2023-09-25T10:35:17Z","title":"LORD: Low Rank Decomposition Of Monolingual Code LLMs For One-Shot Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14021","snapshot_observed_at":"2026-08-04T12:54:31.437126Z","title":"Lord: Low rank decomposition of monolingual code llms for one-shot compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.437126Z"},"links":{"cited_paper":"/paper/2309.14021","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:f61cb69fe83ceed017bffa457a7411ada63e8a530d8dcfbe523eb89c25892285","observation_id":"dedb3b3c-0143-447c-86ac-5a807bdcfb2e","resolution":{"observed_at":"2026-08-04T12:54:31.437126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.557629Z","title":"Tenenholtz, Lester Mackey, and Nicolo Fusi","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.557629Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:2e965e2ffea1d30d65d015b2ea5b268995b5db30df203d94ba64c0ee9b5abd74","observation_id":"ec62ac58-2159-4e00-978d-e4bd905ef6e1","resolution":{"observed_at":"2026-08-04T12:54:31.557629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.651506Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.651506Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:42f9d174d781a1c6ba30136805e5c742de4266eb7fab525e640fa6f7e370a30f","observation_id":"0f83de22-e96d-4476-9f62-7053a68070a3","resolution":{"observed_at":"2026-08-04T12:54:31.651506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.752334Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.752334Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:34246236f007ca5b7c5255bbaa638da98d04d0b190a3918820e38e9a3afc43d5","observation_id":"31db1703-5b8b-4a93-b2ca-a68b152ecc44","resolution":{"observed_at":"2026-08-04T12:54:31.752334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.894154Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.894154Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:7160e0e593f031f0e1abbe1f219bf3b4d9afc898eda3efee2afb0b92d561977e","observation_id":"643ba7d0-1136-467c-b008-08c2923f039d","resolution":{"observed_at":"2026-08-04T12:54:31.894154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:31.978012Z","title":"L o S parse: Structured compression of large language models based on low-rank and sparse approximation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:31.978012Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:98c24d0e512fe9abc13fbc3b22d33ed96a77a48ef8d94794855e0a1d29936d3d","observation_id":"01fa899c-3f53-4895-be6e-7047fb963ed7","resolution":{"observed_at":"2026-08-04T12:54:31.978012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.133004Z","title":"Relo RA : High-rank training through low-rank updates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.133004Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:5fa91f4c916b36099d4aaba1aa77a6bab3cbe421f4ad8a98c793b19f4f4c4a2f","observation_id":"f261d3aa-14a0-4a8d-9c5a-d529ae8ba1dc","resolution":{"observed_at":"2026-08-04T12:54:32.133004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09632","last_updated":"2025-05-02T15:34:42Z","snapshot_observed_at":"2026-07-06T19:02:11.267510Z","submitted_at":"2024-08-19T01:30:14Z","title":"MoDeGPT: Modular Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09632","snapshot_observed_at":"2026-08-04T12:54:32.247901Z","title":"Modegpt: Modular decomposition for large language model compression, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.247901Z"},"links":{"cited_paper":"/paper/2408.09632","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:33887f05ee8d507d26f85f6a5598fbe6307157371085f6e00b61e83330fe47f9","observation_id":"77cdf235-0bfd-4f03-99a5-b557d1825d12","resolution":{"observed_at":"2026-08-04T12:54:32.247901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.347427Z","title":"Duquant: Distributing outliers via dual transformation makes stronger quantized LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.347427Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:dd7c1ea10985e45f0a9e5b1abe3ce88642a7e633418e1b0e1675bdcd7cbad3e7","observation_id":"83137743-3cb1-4ff3-b11a-6cf1c74487d4","resolution":{"observed_at":"2026-08-04T12:54:32.347427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.471274Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.471274Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:521d964db6f4f18233aad492a25c7f2c22d53e91226bc1e8d59fd6fe694afe15","observation_id":"9f0d11ae-4f6e-4531-a7cc-a1a6c23fc160","resolution":{"observed_at":"2026-08-04T12:54:32.471274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-04T12:54:32.527232Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.527232Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:22f743987d7b12cce3e1213ff0df28b52e194be13bbaebaccf88da42349aef27","observation_id":"5ae5674c-ffb0-4b20-839e-613f321f3d60","resolution":{"observed_at":"2026-08-04T12:54:32.527232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T12:54:32.615317Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.615317Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:2a5169509644cf152de526175001da5535d9bbf4c7f7a96a0dbe66562c60734b","observation_id":"07b3b64d-3b08-49e8-8f1c-d43f6e3b80c1","resolution":{"observed_at":"2026-08-04T12:54:32.615317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.698827Z","title":"Dora: weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.698827Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:628bd1e901bf42a72f8a0f3e3d96f363630a6511619aaff4c22c6f8f9b5b67ee","observation_id":"0258c38e-9abe-4a8a-b13e-c7ebc7dac914","resolution":{"observed_at":"2026-08-04T12:54:32.698827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.861188Z","title":"Eora: Fine-tuning-free compensation for compressed llm with eigenspace low-rank approximation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.861188Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:959c01b604771edbd4b8e801ea2b666230c11c6b441ed74f7f7cde4838456623","observation_id":"dd5384e6-bb56-4bcc-8dd3-d47a66c0135b","resolution":{"observed_at":"2026-08-04T12:54:32.861188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:32.977760Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:32.977760Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:b6bd6307bb8bcad4cf98584bafd1cda86de6a6fde0c4dc826170e20e33c83e8a","observation_id":"7ac60136-ac83-4676-a145-dda4bcac9790","resolution":{"observed_at":"2026-08-04T12:54:32.977760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.097917Z","title":"Pi SSA : Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.097917Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:238f904c54cbda4e3834f9fd9883ba5823be6898bfd5d0771548d082209fff98","observation_id":"953b5e5b-d8ec-4d75-a517-f86fd2b5d80d","resolution":{"observed_at":"2026-08-04T12:54:33.097917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-04T11:24:11.301809Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-04T12:54:33.214208Z","title":"Accelerating sparse deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.214208Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:6e073d4f381adab787369ab8d45f7e03723c945e1840a27e7564780de8e2abba","observation_id":"3dbea6ef-0b63-4017-9997-9c4ea74232fe","resolution":{"observed_at":"2026-08-04T12:54:33.214208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.322566Z","title":"Dobi-svd: Differentiable svd for llm compression and some new perspectives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.322566Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:6f660395f3a07a6a6e6a2948b728efdad250bfd260e626df6e0116c81797e7bf","observation_id":"d439b2ad-6e08-4225-bfbd-55466bb6f4e4","resolution":{"observed_at":"2026-08-04T12:54:33.322566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.440915Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.440915Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:f2778e0133b46cf0a28e7ad8479d7449e592f631545c3c07f1a43fc0aacc40aa","observation_id":"6f961544-b9b2-4dd2-8839-cc51cc6df62f","resolution":{"observed_at":"2026-08-04T12:54:33.440915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.536976Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.536976Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:b9579230aa10f0a09fdf027d33cc9c3da65e9c6ee0d10edc05cc63c301c993ea","observation_id":"c43b9212-5043-4bf1-9d40-21ba7e391419","resolution":{"observed_at":"2026-08-04T12:54:33.536976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.587104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.587104Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:4257ad39d23708bee214fd8ac73f1e538f248286197c97d0eb257689099e2fd0","observation_id":"278dc369-fde2-4308-9668-e49d0114f923","resolution":{"observed_at":"2026-08-04T12:54:33.587104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.690785Z","title":"Compressing large language models using low rank and low precision decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.690785Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:82db614c48f36894ce396749eb2db5282d27ec8780787c7e578acd1c53912b1c","observation_id":"31e01949-78d7-4159-beb9-0126df88ca27","resolution":{"observed_at":"2026-08-04T12:54:33.690785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.809317Z","title":"ESPACE : Dimensionality reduction of activations for model compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.809317Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:21cce41f6a1bb097694d62ed8585e7b529db399b59c6255a579ae34627ab3555","observation_id":"342da8c0-a4e9-4b3f-9574-f2d413e0f6b4","resolution":{"observed_at":"2026-08-04T12:54:33.809317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:33.919849Z","title":"Robust low-rank training via approximate orthonormal constraints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:33.919849Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:c468c85ad1f3c2e85c3d9f68f64a16f34a406c14d2c30f5005dcd606c6ccf574","observation_id":"e920ecbc-9788-49b6-8e95-0174b00261b3","resolution":{"observed_at":"2026-08-04T12:54:33.919849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.055161Z","title":"Low-rank lottery tickets: finding efficient low-rank neural networks via matrix differential equations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.055161Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:0a5aad53ce73fb0ca447ea0dfdf8fcccb469bbaee246604ef0697ba790f27c24","observation_id":"1ea1abe1-5963-4ead-a7f4-2d53663b6ac1","resolution":{"observed_at":"2026-08-04T12:54:34.055161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.234225Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.234225Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:7d612e70031dd89df4d36d0a98da2658801a3b32d791010e28831ff9b3e2cfc3","observation_id":"93e826c3-8a4c-4eb0-a545-a663f681d28b","resolution":{"observed_at":"2026-08-04T12:54:34.234225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13558","last_updated":"2023-12-21T03:51:08Z","snapshot_observed_at":"2026-08-08T15:06:43.357303Z","submitted_at":"2023-12-21T03:51:08Z","title":"The Truth is in There: Improving Reasoning in Language Models with Layer-Selective Rank Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13558","snapshot_observed_at":"2026-08-04T12:54:34.403786Z","title":"The truth is in there: Improving reasoning in language models with layer-selective rank reduction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.403786Z"},"links":{"cited_paper":"/paper/2312.13558","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:d540cbb8e7df644235947051bcc13273fd638fb16a44dbac95cb8e0fced27229","observation_id":"586d5a36-5a80-422b-b19e-72f3bccac425","resolution":{"observed_at":"2026-08-04T12:54:34.403786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.560871Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.560871Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:73d9e29cc256bf83f8c1f4889cd5f825b08dceeeb6a678d507729e1d46c72c66","observation_id":"528f9003-faa7-48b4-80d5-90af2d766239","resolution":{"observed_at":"2026-08-04T12:54:34.560871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.725960Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.725960Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:c19417bc9a7773994cba16b4515d22acc25589680c53cdb2d4ec7f31d6c2a212","observation_id":"18fd2129-8fbe-4609-949c-f15b7ecfa635","resolution":{"observed_at":"2026-08-04T12:54:34.725960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T12:54:34.850727Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.850727Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:4d07060117ab9837f0bb83474667de064e060da10d8a9e249d3d5b7904e5f7bd","observation_id":"3ae9a8c8-8529-4874-9453-f8d373e940e4","resolution":{"observed_at":"2026-08-04T12:54:34.850727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:34.978563Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:34.978563Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:33cfed1627738ea44cd9dce40f102264b5e9e96f0d7313b662ec4bb686dfc8fa","observation_id":"3e2ec9d2-3863-4724-a5b5-713fdfd1aa2f","resolution":{"observed_at":"2026-08-04T12:54:34.978563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.063112Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.063112Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a60078dbbb4748ba15cd913363bd752ec67dbf1bd5167d1f1fe5f36fa50fd6fe","observation_id":"f0136548-5b07-446f-8cd5-045e713c7f8b","resolution":{"observed_at":"2026-08-04T12:54:35.063112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-04T12:54:35.148840Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.148840Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:fe57318aeb1527191631fb105a2deac3616697e2934cabe1ca1ef2729093a141","observation_id":"bec3bf8d-1d0f-4873-9ac4-a9fea3897be1","resolution":{"observed_at":"2026-08-04T12:54:35.148840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07378","last_updated":"2025-03-16T03:27:33Z","snapshot_observed_at":"2026-07-06T17:43:05.793351Z","submitted_at":"2024-03-12T07:31:18Z","title":"SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07378","snapshot_observed_at":"2026-08-04T12:54:35.258159Z","title":"Svd-llm: Truncation-aware singular value decomposition for large language model compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.258159Z"},"links":{"cited_paper":"/paper/2403.07378","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:09bec6d8e08270ecd9011fee8f68ade31dc56cba44bbd740952185f2e75eb869","observation_id":"d362884c-1a04-4ac8-93cd-c40cc7ca3094","resolution":{"observed_at":"2026-08-04T12:54:35.258159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.361956Z","title":"S mooth Q uant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.361956Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:47339eb92e27a42cf6f29774d1fc3a5d88c5299e8c56072dc6d8c3f5b5c6be4b","observation_id":"c321b518-a77c-447f-97dd-88711359f07e","resolution":{"observed_at":"2026-08-04T12:54:35.361956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05821","snapshot_observed_at":"2026-08-04T12:54:35.464572Z","title":"Asvd: Activation-aware singular value decomposition for compressing large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.464572Z"},"links":{"cited_paper":"/paper/2312.05821","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:a5daa9e01209a8b941bd3ed20447f0b4fc6dcec5f34e9abd5d8ae9eac8f63198","observation_id":"3a849161-2923-4d55-bd1f-e3a7efe8544a","resolution":{"observed_at":"2026-08-04T12:54:35.464572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12043","last_updated":"2023-08-23T10:08:10Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T10:08:10Z","title":"IncreLoRA: Incremental Parameter Allocation Method for Parameter-Efficient Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12043","snapshot_observed_at":"2026-08-04T12:54:35.581040Z","title":"Increlora: Incremental parameter allocation method for parameter-efficient fine-tuning, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.581040Z"},"links":{"cited_paper":"/paper/2308.12043","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:d45a3e513a891f03bb0f75e8f7a51306526073982dfc6060687219978f664210","observation_id":"fd338049-9301-4ef7-b7ea-92b6c9f09adf","resolution":{"observed_at":"2026-08-04T12:54:35.581040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.660902Z","title":"Adaptive budget allocation for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.660902Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:fe99197f1a22e2a476eb34311d221c55dc1c2ea2c83e0eb262bd55b2f92dc568","observation_id":"a45d9535-e250-4bd4-bb31-6d366b7a860a","resolution":{"observed_at":"2026-08-04T12:54:35.660902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.775920Z","title":"OATS : Outlier-aware pruning through sparse and low rank decomposition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.775920Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:65b2a15c4390d6970a4164920fd1d639309eb5012b271dc5466e0e7f403f994d","observation_id":"b1bce96b-694c-43aa-9b5e-4f059156fc26","resolution":{"observed_at":"2026-08-04T12:54:35.775920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:35.900097Z","title":"Plug-and-play: An efficient post-training pruning method for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.900097Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:07c2ae8f0348fe5a59d2e4f7b1fb30bc2bc7e5ea693909d52e526cc28980f467","observation_id":"dc3d7516-ad5f-4dd5-a41c-de003089dfb9","resolution":{"observed_at":"2026-08-04T12:54:35.900097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19090","last_updated":"2025-08-13T06:56:55Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T12:36:31Z","title":"Pivoting Factorization: A Compact Meta Low-Rank Representation of Sparsity for Efficient Inference in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19090","snapshot_observed_at":"2026-08-04T12:54:35.977946Z","title":"Pivoting factorization: A compact meta low-rank representation of sparsity for efficient inference in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:35.977946Z"},"links":{"cited_paper":"/paper/2501.19090","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:ca9be6a22f9320e00ffdc9f8ac882df7281b30c87e00eb367d49f21e69f948cf","observation_id":"0f894493-e622-4418-a1e9-097317145de2","resolution":{"observed_at":"2026-08-04T12:54:35.977946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11250","last_updated":"2024-01-01T03:43:41Z","snapshot_observed_at":"2026-08-06T13:53:33.999451Z","submitted_at":"2023-06-20T03:03:04Z","title":"InRank: Incremental Low-Rank Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11250","snapshot_observed_at":"2026-08-04T12:54:36.066165Z","title":"Inrank: Incremental low-rank learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.066165Z"},"links":{"cited_paper":"/paper/2306.11250","citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:db56d2cab81138dbeb4be7e4ba4bd98ba7256d2770f034a46fa8f4f7a590d433","observation_id":"6dd34c8b-9224-430b-aadc-c57a7b72dc78","resolution":{"observed_at":"2026-08-04T12:54:36.066165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.165106Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.165106Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:f6d9800f13171779318d7d15a3c9f6647b7978b2ea6cac735c7ac340f9ca52f4","observation_id":"2f8f7a76-881c-47a7-8042-894e98116cea","resolution":{"observed_at":"2026-08-04T12:54:36.165106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.285194Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.285194Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:650986b98137c9098b8101b019e59d22f548039648ecaf7c4ce1a84daba15744","observation_id":"1d17f1a5-7d81-45eb-8f50-b2065d4371e8","resolution":{"observed_at":"2026-08-04T12:54:36.285194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.403613Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.403613Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:e24d99385309a4c0f6d1e9f3bdac1491b32eba236a797354c2858c18711ba806","observation_id":"93e27143-3258-49e6-9bd8-d9078579c549","resolution":{"observed_at":"2026-08-04T12:54:36.403613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:54:36.489014Z","title":"u `:^!t )GeuwokcJ _ ]n?ICq .WT +BCBC &q=2","venue":null,"work_id":null,"year":2060},"citing_paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T12:54:36.489014Z"},"links":{"citing_paper":"/paper/2510.01718"},"observation_digest":"sha256:7e9a36ad1b1436751708152fb4c0eead228f2c8ba8570c811575e13dfb0dc7bf","observation_id":"07ee1195-c7ea-4742-86e3-af5f4901c69b","resolution":{"observed_at":"2026-08-04T12:54:36.489014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.01718","last_updated":"2026-06-26T05:02:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T22:37:27.971509Z","submitted_at":"2025-10-02T06:58:10Z","title":"Accelerating Attention with Basis Decomposition"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2510.01718."}