{"as_of":"2026-08-16T04:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be37d5f7c84ae21f01fb50b700444af5484407e29425fa86ff5a1a049f526e7e","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:44:20.123934Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:01:14.921682Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T02:06:42.157809Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-07-10T02:06:42.157809Z","title":"Lost: Low-rank and sparse pre-training for large language models","venue":"cs.LG","work_id":"bb0da036-ec27-4e71-8ea9-a0d693879fe4","year":2025},"citing_paper":{"arxiv_id":"2509.18993","last_updated":"2026-05-13T13:30:21Z","snapshot_observed_at":"2026-08-13T00:23:08.953189Z","submitted_at":"2025-09-23T13:43:02Z","title":"CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T14:51:30.312509Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2509.18993"},"observation_digest":"sha256:980d0f02df528b9ae85e87f7d555829545b49aea60466802a05f04a12fe8f383","observation_id":"93b6c660-bcd1-4dda-9f8a-60a1ea3f25cc","resolution":{"observed_at":"2026-05-18T14:52:41.334819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-07-10T02:06:42.157809Z","title":"Lost: Low-rank and sparse pre-training for large language models","venue":"cs.LG","work_id":"bb0da036-ec27-4e71-8ea9-a0d693879fe4","year":2025},"citing_paper":{"arxiv_id":"2512.12131","last_updated":"2026-05-11T19:05:27Z","snapshot_observed_at":"2026-08-14T06:30:26.125254Z","submitted_at":"2025-12-13T01:50:18Z","title":"BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T23:19:02.358348Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2512.12131"},"observation_digest":"sha256:42491a4faf57b21b528b761669d77f464c3ff8402d566e6a73b004a09c890a72","observation_id":"f2a6803d-cf78-40f8-977a-7e89afb9b216","resolution":{"observed_at":"2026-05-16T23:21:21.574771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-08-03T06:01:14.921682Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.00942","last_updated":"2026-05-28T22:25:40Z","snapshot_observed_at":"2026-08-10T20:43:52.684307Z","submitted_at":"2026-02-01T00:00:11Z","title":"SALAAD: Sparse And Low-Rank Adaptation via ADMM for Large Language Model Inference","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:01:14.921682Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2602.00942"},"observation_digest":"sha256:9a0244d9acc242cf99699c8cea40ecf31e8037e81e3310eb0dd53a05c2148859","observation_id":"14b5ae28-76fd-4843-9180-75a2e7fd78ab","resolution":{"observed_at":"2026-08-03T06:01:14.921682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-07-10T02:06:42.157809Z","title":"Lost: Low-rank and sparse pre-training for large language models","venue":"cs.LG","work_id":"bb0da036-ec27-4e71-8ea9-a0d693879fe4","year":2025},"citing_paper":{"arxiv_id":"2604.00733","last_updated":"2026-04-05T12:23:35Z","snapshot_observed_at":"2026-08-13T02:56:22.234510Z","submitted_at":"2026-04-01T10:53:56Z","title":"Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T22:54:02.492105Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2604.00733"},"observation_digest":"sha256:2c4507d3aa4a5999c5303746efb5465ff761f318a82f4777f5d45d379357489d","observation_id":"431d40f3-7e33-4534-9efe-08c4e1ff636f","resolution":{"observed_at":"2026-05-13T22:58:24.130724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-07-10T02:06:42.157809Z","title":"Lost: Low-rank and sparse pre-training for large language models","venue":"cs.LG","work_id":"bb0da036-ec27-4e71-8ea9-a0d693879fe4","year":2025},"citing_paper":{"arxiv_id":"2604.21905","last_updated":"2026-04-23T17:50:23Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:50:23Z","title":"Low-Rank Adaptation Redux for Large Models","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-09T21:48:48.992712Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2604.21905"},"observation_digest":"sha256:4018e7ee5a215b5b46f872d421207690db8d4affb8fa87790c1a0e051f80cb5b","observation_id":"88079b2f-06d7-49d5-9aec-0f4af1e9a2b1","resolution":{"observed_at":"2026-05-11T14:26:03.945876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-07-10T02:06:42.157809Z","title":"Lost: Low-rank and sparse pre-training for large language models","venue":"cs.LG","work_id":"bb0da036-ec27-4e71-8ea9-a0d693879fe4","year":2025},"citing_paper":{"arxiv_id":"2605.13652","last_updated":"2026-05-19T00:27:00Z","snapshot_observed_at":"2026-08-15T01:30:25.471813Z","submitted_at":"2026-05-13T15:11:37Z","title":"Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T19:19:18.275446Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2605.13652"},"observation_digest":"sha256:091bdd34d505c99574dd3c9b5e896ef8cd4b56826d2e5b73c9aa0c2a2975824a","observation_id":"6c295afb-2937-4f93-acd1-776ca5c533dc","resolution":{"observed_at":"2026-05-14T19:19:23.495124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-07-10T02:06:42.157809Z","title":"Lost: Low-rank and sparse pre-training for large language models","venue":"cs.LG","work_id":"bb0da036-ec27-4e71-8ea9-a0d693879fe4","year":2025},"citing_paper":{"arxiv_id":"2605.13652","last_updated":"2026-05-19T00:27:00Z","snapshot_observed_at":"2026-08-15T01:30:25.471813Z","submitted_at":"2026-05-13T15:11:37Z","title":"Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T20:24:26.681383Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2605.13652"},"observation_digest":"sha256:d2449d6543bb0e7d4910e7dc0ef068ba9fc9d1e8392211b518cd2eebc29df458","observation_id":"dc1cc48d-ca4d-44dd-a91f-e8baaed1dd73","resolution":{"observed_at":"2026-05-20T20:28:59.916751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02668","snapshot_observed_at":"2026-07-10T02:06:42.157809Z","title":"Lost: Low-rank and sparse pre-training for large language models","venue":"cs.LG","work_id":"bb0da036-ec27-4e71-8ea9-a0d693879fe4","year":2025},"citing_paper":{"arxiv_id":"2607.08754","last_updated":"2026-07-09T17:51:50Z","snapshot_observed_at":"2026-08-14T12:29:50.986877Z","submitted_at":"2026-07-09T17:51:50Z","title":"SLORR: Simple and Efficient In-Training Low-Rank Regularization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T01:58:58.772489Z"},"links":{"cited_paper":"/paper/2508.02668","citing_paper":"/paper/2607.08754"},"observation_digest":"sha256:4b59d977dbda569458095ceb406359a387b706fc56b1f0ca6e8ac1ab42f3a1ea","observation_id":"730d5a5a-15dd-481e-9583-4151a9f46e6d","resolution":{"observed_at":"2026-07-10T02:06:42.159982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.02668/citation-record","integrity":"/paper/2508.02668/integrity","json":"/paper/2508.02668/citation-record.json","paper":"/paper/2508.02668"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.970902Z","title":"From words to watts: Benchmarking the energy costs of large language model inference","venue":null,"work_id":"1e4c0798-4fcd-4a9a-879f-9d65d2b54e92","year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.921716Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:7c5b0b7e5b8504a9e5d2729659f27622c329633160b5c28438c7d13a555a0aae","observation_id":"653e2635-a16e-4d75-b532-157bfb08ee6a","resolution":{"observed_at":"2026-08-15T17:44:20.975978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:19.928432Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.928432Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:2e13f9a5e17e471156ac220aa29a45006e9d9a314e7d12e07b433687cc9fd5b3","observation_id":"f23d8d50-c46a-4ffa-bcfd-51bcbc315a77","resolution":{"observed_at":"2026-08-15T17:44:19.928432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:19.933961Z","title":"Adaptive budget allocation for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.933961Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:632f23195bb5568f17bbe270baa952d648da90ee891abd0c232f30eb4319f564","observation_id":"c49d1c7f-7aa2-4255-b26d-8bdb5643372f","resolution":{"observed_at":"2026-08-15T17:44:19.933961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09578","last_updated":"2024-04-12T23:15:51Z","snapshot_observed_at":"2026-08-13T05:24:11.208172Z","submitted_at":"2023-11-16T05:29:39Z","title":"Tied-Lora: Enhancing parameter efficiency of LoRA with weight tying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09578","snapshot_observed_at":"2026-08-15T17:44:19.938654Z","title":"Tied-lora: Enhacing parameter efficiency of lora with weight tying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.938654Z"},"links":{"cited_paper":"/paper/2311.09578","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:4ea00323ee05bb565441528ba91f9e1e9fd45efd5e3f34c87d4391a66e65230c","observation_id":"1eb9db9f-e9fc-4a14-991e-c238ebc1a325","resolution":{"observed_at":"2026-08-15T17:44:19.938654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03285","last_updated":"2024-06-05T06:06:43Z","snapshot_observed_at":"2026-08-13T05:31:57.731482Z","submitted_at":"2023-11-06T17:26:17Z","title":"S-LoRA: Serving Thousands of Concurrent LoRA Adapters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03285","snapshot_observed_at":"2026-08-15T17:44:19.943682Z","title":"S-lora: Serving thousands of concurrent lora adapters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.943682Z"},"links":{"cited_paper":"/paper/2311.03285","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:b1d98c1fbc658a9bd76b0daf5f0ffd1588160065c2b4b09a024d92ffc4dea054","observation_id":"3b867b7f-f663-4bb4-9db2-8fdb7b139ab2","resolution":{"observed_at":"2026-08-15T17:44:19.943682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-15T17:44:19.948554Z","title":"Dora: Weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.948554Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:338f72b0815740bb3e254c4fe404198473421072c37fc9cb7087333c8b2d9e22","observation_id":"479367a4-81b3-4ff0-8794-b7755d974e28","resolution":{"observed_at":"2026-08-15T17:44:19.948554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11454","last_updated":"2024-01-16T18:59:22Z","snapshot_observed_at":"2026-08-13T05:47:23.578307Z","submitted_at":"2023-10-17T17:59:46Z","title":"VeRA: Vector-based Random Matrix Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11454","snapshot_observed_at":"2026-08-15T17:44:19.953651Z","title":"Vera: Vector-based random matrix adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.953651Z"},"links":{"cited_paper":"/paper/2310.11454","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:07dd8716cddab66c8dcd8fc01dd3ec1c49f4d5eb25441fdf8a8299d8d6f4d18e","observation_id":"0703212b-4aa1-4d22-8783-926ab7db9cd9","resolution":{"observed_at":"2026-08-15T17:44:19.953651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:19.958401Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.958401Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:9327c8b16ff466c443f2e810eadac0c38ca9e00d192d359c8c39a426237e7f7c","observation_id":"d00ccf2c-9f3e-439c-b135-39af7336f0f0","resolution":{"observed_at":"2026-08-15T17:44:19.958401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.926116Z","title":"Initialization and regular- ization of factorized neural layers","venue":null,"work_id":"d4acf94e-338c-43a0-b164-fd788e677cf5","year":2021},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.963049Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:a4f37c7a9f39602ba0da78fe5d0ff4bcfa71bcdd221c977a007e2679319df35f","observation_id":"309eec51-1224-43fa-aad6-6084f28ae426","resolution":{"observed_at":"2026-08-15T17:44:20.930648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13710","last_updated":"2023-01-31T15:40:50Z","snapshot_observed_at":"2026-08-13T12:54:14.643134Z","submitted_at":"2023-01-31T15:40:50Z","title":"On the Initialisation of Wide Low-Rank Feedforward Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13710","snapshot_observed_at":"2026-08-15T17:44:19.967395Z","title":"On the initialisation of wide low-rank feedforward neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.967395Z"},"links":{"cited_paper":"/paper/2301.13710","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:332ba7aca2e2c9e0581f37dbfba3e9faeff1ce02bf5ddc2896925e2cae68d3c2","observation_id":"0a56494e-30e8-48cc-8140-8819ceaaf75c","resolution":{"observed_at":"2026-08-15T17:44:19.967395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-14T16:50:01.023936Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-15T17:44:19.971937Z","title":"Exploring low rank training of deep neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.971937Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:7d98979e6833dba66a6e529e43572afa39676e0848881194b2371eca5b2b8e73","observation_id":"c1f8dcf2-c60c-4465-91ff-823ea3ea38ca","resolution":{"observed_at":"2026-08-15T17:44:19.971937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.911598Z","title":"Relora: High-rank training through low-rank updates","venue":null,"work_id":"7b6cf0ac-7373-49f2-8e4a-aa8ee3bc8850","year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.976525Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:6ee4ab78b1f9b123857d114f704d8e5db440af9eb738b075f79387ccf225a2e2","observation_id":"f4a609db-ac42-47f6-81a9-00614a8e714a","resolution":{"observed_at":"2026-08-15T17:44:20.916242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11239","last_updated":"2025-06-07T06:59:36Z","snapshot_observed_at":"2026-08-12T23:21:37.384058Z","submitted_at":"2024-07-15T21:05:20Z","title":"From Low Rank Gradient Subspace Stabilization to Low-Rank Weights: Observations, Theories, and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11239","snapshot_observed_at":"2026-08-15T17:44:19.980700Z","title":"From galore to welore: How low-rank weights non-uniformly emerge from low-rank gradients","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.980700Z"},"links":{"cited_paper":"/paper/2407.11239","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:a786fa5791a275fff0f65671c8fb4c9499cf1dcb869205068353f561b6ec2360","observation_id":"023937b8-2daa-4d79-872f-e23c85288eff","resolution":{"observed_at":"2026-08-15T17:44:19.980700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.897496Z","title":"Investigating low-rank training in transformer language models: Efficiency and scaling analysis","venue":null,"work_id":"abafa5ca-f910-4e6b-81ae-7aebf4857111","year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.985049Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:f04babcf1d6488e20b72fe7aca108301bcfb988e5bcd049f4f29f882f9fc28f8","observation_id":"dce4fa70-208c-4224-9b8b-ed52f94270a4","resolution":{"observed_at":"2026-08-15T17:44:20.901928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.883536Z","title":"Full-rank no more: Low-rank weight training for modern speech recognition models","venue":null,"work_id":"0a281551-9117-4f93-bd47-42e1b3603975","year":2025},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.989255Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:0e1614c54fde3bf76b87fbee8f75e9d926ac9c69501c085f0473199455bf8154","observation_id":"f9bfbb79-d420-4d1f-bacc-1548378ada1a","resolution":{"observed_at":"2026-08-15T17:44:20.888036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-08-15T01:25:39.422061Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-15T17:44:19.993388Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.993388Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:458fb9a0512a010b5dc9514d0d94c20d3c7f4f28e49e8a49d9b082026642ecbc","observation_id":"cd650398-4963-4ded-9624-0102046aa521","resolution":{"observed_at":"2026-08-15T17:44:19.993388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:19.998013Z","title":"Fira: Can we achieve full-rank training of llms under low-rank constraint? arXiv preprint arXiv:2410.01623, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:19.998013Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:552970f24f1aad7361669e57aaa76dbaef4ddd22e1358cf071f9c45952ae2ff4","observation_id":"d8ae0927-724c-4885-b45f-0d66cdc61c8b","resolution":{"observed_at":"2026-08-15T17:44:19.998013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-11T20:47:03.266207Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-15T17:44:20.002334Z","title":"Apollo: Sgd-like memory, adamw-level performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.002334Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:68eb25edfaeea355192e5452bd10f1fa7bf2716da8e25080af56e43c7a5e3f36","observation_id":"21ef9879-1b50-426c-ae10-2f909a2f3e20","resolution":{"observed_at":"2026-08-15T17:44:20.002334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08296","last_updated":"2024-07-11T08:42:58Z","snapshot_observed_at":"2026-08-13T18:35:37.489771Z","submitted_at":"2024-07-11T08:42:58Z","title":"Q-GaLore: Quantized GaLore with INT4 Projection and Layer-Adaptive Low-Rank Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08296","snapshot_observed_at":"2026-08-15T17:44:20.006961Z","title":"Q-galore: Quantized galore with int4 projection and layer-adaptive low-rank gradients","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.006961Z"},"links":{"cited_paper":"/paper/2407.08296","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:eb365e688a2832eff980ae9d08af009124ac2bf5fc99485127ef962f581c7ccf","observation_id":"07b3e26b-c6b7-4ab6-8c57-a7488d74c387","resolution":{"observed_at":"2026-08-15T17:44:20.006961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.869316Z","title":"SLTrain: a sparse plus low rank approach for parameter and memory efficient pretraining","venue":null,"work_id":"af9d88d3-ed0c-43eb-8449-6b8e8a3dd815","year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.011436Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:b3ac9a36a22becab9f53aae4bf62bc43fd9e02f523d09a4719a7f9e9d60d3683","observation_id":"ce310c51-70c4-4cc9-9cd5-5b12863b6af1","resolution":{"observed_at":"2026-08-15T17:44:20.874153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.015537Z","title":"Losparse: Structured compression of large language models based on low-rank and sparse approximation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.015537Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:c1463850ae9d12c1653d3b08f83e201cd1cba5d8e371d49c2fbaf4c20a68c1d9","observation_id":"481246bc-ec1c-48b8-8b9e-b7bcc6a136f9","resolution":{"observed_at":"2026-08-15T17:44:20.015537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14816","last_updated":"2025-02-20T18:37:32Z","snapshot_observed_at":"2026-08-10T20:02:39.265193Z","submitted_at":"2025-02-20T18:37:32Z","title":"Dynamic Low-Rank Sparse Adaptation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14816","snapshot_observed_at":"2026-08-15T17:44:20.019624Z","title":"Dynamic low-rank sparse adaptation for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.019624Z"},"links":{"cited_paper":"/paper/2502.14816","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:deecd6e35a9d7ed185191f1fc6bb8486efc97a36c16249e56a8918f7c821bc9b","observation_id":"775de906-647b-46ff-a9dc-7c25d8265aa3","resolution":{"observed_at":"2026-08-15T17:44:20.019624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11696","last_updated":"2023-11-20T11:56:25Z","snapshot_observed_at":"2026-08-13T14:46:28.134591Z","submitted_at":"2023-11-20T11:56:25Z","title":"Sparse Low-rank Adaptation of Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11696","snapshot_observed_at":"2026-08-15T17:44:20.024007Z","title":"Sparse low-rank adaptation of pre-trained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.024007Z"},"links":{"cited_paper":"/paper/2311.11696","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:e4a1f1016bb259dd9d3bcc6f8583d895c588ef84f7454ff6116b7bdda3c68a63","observation_id":"0e40d821-8688-444c-8112-c90f61ba3cbb","resolution":{"observed_at":"2026-08-15T17:44:20.024007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.846969Z","title":"Pissa: Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":"cc0caa95-451a-44cf-90bc-f30e37827a83","year":2025},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.028518Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:4c99c6bbc1db7a0f685155956857b47bff1193b95371ca16967541a014073963","observation_id":"1babcc04-b00e-47de-b94c-0006ad552cab","resolution":{"observed_at":"2026-08-15T17:44:20.851405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17604","last_updated":"2025-08-19T19:14:56Z","snapshot_observed_at":"2026-08-12T23:56:46.255255Z","submitted_at":"2024-05-27T19:07:13Z","title":"LoRA-XS: Low-Rank Adaptation with Extremely Small Number of Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17604","snapshot_observed_at":"2026-08-15T17:44:20.032658Z","title":"Lora-xs: Low-rank adaptation with extremely small number of parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.032658Z"},"links":{"cited_paper":"/paper/2405.17604","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:df713592bea5bdea01b707288b765ef31ddb1982d99bbf39571e15ce503d753c","observation_id":"01dffb2d-65cf-4d65-b454-a57ec7ade47a","resolution":{"observed_at":"2026-08-15T17:44:20.032658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10280","last_updated":"2024-08-27T15:34:49Z","snapshot_observed_at":"2026-08-15T06:11:36.581254Z","submitted_at":"2024-08-18T12:18:56Z","title":"NoRA: Nested Low-Rank Adaptation for Efficient Fine-Tuning Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10280","snapshot_observed_at":"2026-08-15T17:44:20.037368Z","title":"Nora: Nested low-rank adaptation for efficient fine-tuning large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.037368Z"},"links":{"cited_paper":"/paper/2408.10280","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:549db84d0f32a25187056a0793268886ff6dcae8efa27309c795ec26dd0127c3","observation_id":"b389bf80-8f3b-4c60-80a4-906c95d75456","resolution":{"observed_at":"2026-08-15T17:44:20.037368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.041836Z","title":"Parameter efficient fine-tuning via explained variance adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.041836Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:d06830aac1c84911279e9d49a6e1fbf25c2477c1d04506d626287b5b3e962803","observation_id":"a9ece71d-9139-4c73-98c9-32e93ab62ffc","resolution":{"observed_at":"2026-08-15T17:44:20.041836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12067","last_updated":"2025-01-21T11:42:09Z","snapshot_observed_at":"2026-08-14T01:24:03.402706Z","submitted_at":"2025-01-21T11:42:09Z","title":"EDoRA: Efficient Weight-Decomposed Low-Rank Adaptation via Singular Value Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12067","snapshot_observed_at":"2026-08-15T17:44:20.046020Z","title":"Edora: Efficient weight-decomposed low-rank adaptation via singular value decomposition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.046020Z"},"links":{"cited_paper":"/paper/2501.12067","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:df2a8ad64c2b334d198080cdb9a0ebe046ba41ae82322ce2a294fc740c1a18c4","observation_id":"316709d5-49ea-40bc-aff3-b62a6857813d","resolution":{"observed_at":"2026-08-15T17:44:20.046020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.050577Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.050577Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:841be1d303f4dc595b0e2a69b13c8f1d5874d509d1b99a168aabd11bd8f78922","observation_id":"fd054f5f-97d6-45b5-ae4d-0e9248a7e069","resolution":{"observed_at":"2026-08-15T17:44:20.050577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14717","last_updated":"2023-10-09T07:39:04Z","snapshot_observed_at":"2026-08-15T04:23:13.328430Z","submitted_at":"2023-09-26T07:22:23Z","title":"QA-LoRA: Quantization-Aware Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14717","snapshot_observed_at":"2026-08-15T17:44:20.054800Z","title":"Qa-lora: Quantization-aware low-rank adaptation of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.054800Z"},"links":{"cited_paper":"/paper/2309.14717","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:4ebc7321279dabd7992efc2e9345e705f4f0eebc3df7285fc15d258b8e75d2ec","observation_id":"e66f8373-0d84-44a7-b1eb-d518d337be62","resolution":{"observed_at":"2026-08-15T17:44:20.054800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-08-13T10:08:08.030837Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-15T17:44:20.059283Z","title":"Longlora: Efficient fine-tuning of long-context large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.059283Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:7497d21d194a2af79043b177cdda5be0232338769d6745c86de541ab36d293f3","observation_id":"9f607441-46e9-482a-bbeb-7059a00d3df5","resolution":{"observed_at":"2026-08-15T17:44:20.059283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.824050Z","title":"Pixelated butterfly: Simple and efficient sparse training for neural network models","venue":null,"work_id":"bc373742-bf1f-4b32-9dc2-f184dbeab8dc","year":2022},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.063826Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:ad1403a4be047ff925d2f29b35e0f9b621a698dc133eb202b40f3dddca16a410","observation_id":"88e11372-3695-43e5-82e2-bac5eee9ccfe","resolution":{"observed_at":"2026-08-15T17:44:20.828501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13652","last_updated":"2025-05-20T13:06:00Z","snapshot_observed_at":"2026-08-12T22:40:50.337164Z","submitted_at":"2024-09-20T17:02:00Z","title":"OATS: Outlier-Aware Pruning Through Sparse and Low Rank Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13652","snapshot_observed_at":"2026-08-15T17:44:20.067925Z","title":"Oats: Outlier-aware pruning through sparse and low rank decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.067925Z"},"links":{"cited_paper":"/paper/2409.13652","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:a5577af05f1fbaa9b09f4bc0a219b5c54bc038accc983793b9e9f106478efd14","observation_id":"72dc95d8-c7c8-4ef1-a7a8-90a8a797a8b4","resolution":{"observed_at":"2026-08-15T17:44:20.067925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.072472Z","title":"Robust principal component analysis? Journal of the ACM (JACM), 58(3):1–37, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.072472Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:03338128cfaaba4f16f9f70a4812571e030a0463e933177e81ef0414a8a58253","observation_id":"7a2c524c-3dd1-4f7e-a3a8-2ce1de59cfb1","resolution":{"observed_at":"2026-08-15T17:44:20.072472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00899","last_updated":"2025-02-02T20:23:32Z","snapshot_observed_at":"2026-08-14T00:37:34.804891Z","submitted_at":"2025-02-02T20:23:32Z","title":"HASSLE-free: A unified Framework for Sparse plus Low-Rank Matrix Decomposition for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00899","snapshot_observed_at":"2026-08-15T17:44:20.076512Z","title":"Hassle- free: A unified framework for sparse plus low-rank matrix decomposition for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.076512Z"},"links":{"cited_paper":"/paper/2502.00899","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:cce98c09716c8cd26c3f18db0a39c5d48cb572bf18611fe5e28ff32b68b3f8de","observation_id":"71852d66-0be9-480d-bbe8-31d0c08372ca","resolution":{"observed_at":"2026-08-15T17:44:20.076512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.800365Z","title":"Parameter and memory efficient pretraining via low-rank riemannian optimization","venue":null,"work_id":"c0ffbea7-396b-4cd2-9fa2-6eb6af1262ac","year":2025},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.080957Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:e9c82a4f105a93f584f6a657bd7c17de74cef47bb65da7e95181524aba1bfa88","observation_id":"09a150ee-47ee-4fed-b6c7-d75afbf2316a","resolution":{"observed_at":"2026-08-15T17:44:20.805054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.085505Z","title":"Cola: Compute-efficient pre-training of llms via low-rank activa- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.085505Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:02737d0aea4ccfd27f998f3eff8090afe06a7aad1a7fa7cf542a047ab354fee0","observation_id":"70bc2e89-9a5e-448a-8f98-fe1482358d88","resolution":{"observed_at":"2026-08-15T17:44:20.085505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.089552Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.089552Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:f55a1a36cce735c57a7afb7b19809e9b66c5b9b4ec712d663b022a60f7c681e6","observation_id":"524183ae-6472-4c77-a1a3-0d5cb17343ca","resolution":{"observed_at":"2026-08-15T17:44:20.089552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07378","last_updated":"2025-03-16T03:27:33Z","snapshot_observed_at":"2026-08-13T18:13:07.594457Z","submitted_at":"2024-03-12T07:31:18Z","title":"SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07378","snapshot_observed_at":"2026-08-15T17:44:20.093532Z","title":"Svd-llm: Truncation-aware singular value decomposition for large language model compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.093532Z"},"links":{"cited_paper":"/paper/2403.07378","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:2ecd326f9c18ad00dbe87d374413bcc723ab7c3df30ea5e0fdc5dde03819c058","observation_id":"ddf5e120-3a58-44ac-ad60-b83fb32a9afd","resolution":{"observed_at":"2026-08-15T17:44:20.093532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.775102Z","title":"Language model compression with weighted low-rank factorization","venue":null,"work_id":"dd30acf4-f18c-401a-b331-ea23e41e7351","year":2022},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.097993Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:eae2259a536ff9dad70ff6581aac2c28e6d98103d8959206e2f70ea5cb782030","observation_id":"dcef69b6-096e-4f6c-a3ca-bafeb2785d8f","resolution":{"observed_at":"2026-08-15T17:44:20.781391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.102159Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.102159Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:bb0febdb37277d40df3866f50ac5da8ab29e20d6f73f67e1659a3d75538a9ed2","observation_id":"830b6fcd-018b-4a74-9f91-e09280c73814","resolution":{"observed_at":"2026-08-15T17:44:20.102159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T17:44:20.106626Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.106626Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:b4c00047021c9eff8048e1ace52fcb09b2f3669d643835d8aa3226dc54d95401","observation_id":"e4afd30e-ab33-43c9-ae62-78fa93399540","resolution":{"observed_at":"2026-08-15T17:44:20.106626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:44:20.111120Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.111120Z"},"links":{"citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:34e7cd064f4ce954fdce3a604cb1d36ee314b48c5f38e64be54fb175f3f6b61c","observation_id":"2ef5faf2-9f46-46db-99db-134e5c0a9e3c","resolution":{"observed_at":"2026-08-15T17:44:20.111120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-15T17:44:20.115079Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.115079Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:1ca0d18e2b371c3e8e982c7bc9b998d0cac78e45eab141126ffeab56fa2e8caa","observation_id":"77639cfb-d69d-46b3-84e2-9dc613567e3c","resolution":{"observed_at":"2026-08-15T17:44:20.115079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T17:44:20.119536Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.119536Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:9af0b2cf6a48778a6a39ae64a02e2f8c8fd09eae30311a7b8257daee8f749d55","observation_id":"33b522a7-07d4-4747-a7c7-9b216e301268","resolution":{"observed_at":"2026-08-15T17:44:20.119536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-15T17:44:20.123934Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:44:20.123934Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2508.02668"},"observation_digest":"sha256:7a15827f07bc03edf2dd91779f33752f68b81fa04303c5644da357a85e0714cd","observation_id":"3ebfeae4-f2ae-4ba3-9e0e-936aef17e034","resolution":{"observed_at":"2026-08-15T17:44:20.123934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.02668","last_updated":"2025-08-04T17:58:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T17:34:34.024495Z","submitted_at":"2025-08-04T17:58:22Z","title":"LOST: Low-rank and Sparse Pre-training for Large Language Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 8 inbound Pith citation observations for arXiv:2508.02668."}