{"as_of":"2026-08-10T13:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dbbd926a05cf7662e64e69ef940443e9521b398b117eb41ef9195844ff936d97","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:36:17.881647Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T08:39:31.911497Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T08:39:53.214305Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.00311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00311","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yang, Mohammad Mohammadi Amiri, Tejaswini Pedap- ati, Subhajit Chaudhury, and Pin-Yu Chen","venue":null,"work_id":"4de0301e-9e1b-44e3-9029-d066edf4670b","year":2025},"citing_paper":{"arxiv_id":"2506.01897","last_updated":"2026-04-25T01:06:47Z","snapshot_observed_at":"2026-07-30T09:10:38.260173Z","submitted_at":"2025-06-02T17:21:10Z","title":"MLorc: Momentum Low-rank Compression for Memory Efficient Large Language Model Adaptation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T10:50:36.629493Z"},"links":{"cited_paper":"/paper/2502.00311","citing_paper":"/paper/2506.01897"},"observation_digest":"sha256:82f2bb16936a0920ed6ee4dc149847fa5af3d6616e4c5d33cc7b4d71e8924278","observation_id":"a3331bde-6d91-4d52-ba99-2af783afbbaa","resolution":{"observed_at":"2026-05-19T10:52:15.108322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.00311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00311","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yang, Mohammad Mohammadi Amiri, Tejaswini Pedap- ati, Subhajit Chaudhury, and Pin-Yu Chen","venue":null,"work_id":"4de0301e-9e1b-44e3-9029-d066edf4670b","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2502.00311","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:def551f9da5baa9c14db3747448941735f509f3bc98fe3d1cb4e0c934855e030","observation_id":"27061e32-7b68-4a2c-90b1-f173f2dba996","resolution":{"observed_at":"2026-05-11T21:31:16.046949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.00311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00311","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yang, Mohammad Mohammadi Amiri, Tejaswini Pedap- ati, Subhajit Chaudhury, and Pin-Yu Chen","venue":null,"work_id":"4de0301e-9e1b-44e3-9029-d066edf4670b","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2502.00311","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:e2bde71894a600fb23c822eee2f74fc0bf1b41112d0d4d7b3948ee2b77d1f2bf","observation_id":"189fef69-51a0-4caf-9c2d-a20fc04556ed","resolution":{"observed_at":"2026-05-21T08:39:53.216763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00311/citation-record","integrity":"/paper/2502.00311/integrity","json":"/paper/2502.00311/citation-record.json","paper":"/paper/2502.00311"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T19:36:17.737864Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.737864Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:62530d473d07637263ad5d4598dbdbad10689a379ceb949bf2ce4dca388e13fe","observation_id":"86eab819-69de-4f1d-917a-13aed460c351","resolution":{"observed_at":"2026-08-09T19:36:17.737864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"math/0502327","last_updated":"2005-02-15T21:12:45Z","snapshot_observed_at":"2026-08-10T12:39:22.295961Z","submitted_at":"2005-02-15T21:12:45Z","title":"Decoding by Linear Programming","version":1},"cited_work":{"arxiv_id":"math/0502327","doi":null,"metadata_source":"pith","pith_arxiv_id":"math/0502327","snapshot_observed_at":"2026-08-09T19:36:18.590051Z","title":"Decoding by Linear Programming","venue":"math.MG","work_id":"f202800f-e567-47b7-8905-1ba5bc62be2f","year":2005},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.742313Z"},"links":{"cited_paper":"/paper/math/0502327","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:ce94add507cf3816e1d25ab77db342f0b3f33d85bf6d6d6ec21e12a90ec87617","observation_id":"f9a38e62-7f78-450e-8323-4f08daaf98fc","resolution":{"observed_at":"2026-08-09T19:36:18.594504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"math/0409186","last_updated":"2004-09-10T18:45:22Z","snapshot_observed_at":"2026-07-07T05:43:20.269338Z","submitted_at":"2004-09-10T18:45:22Z","title":"Robust Uncertainty Principles: Exact Signal Reconstruction from Highly Incomplete Frequency Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"math/0409186","snapshot_observed_at":"2026-08-09T19:36:17.746061Z","title":"Robust uncertainty principles: Exact signal reconstruction from highly incomplete frequency information, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.746061Z"},"links":{"cited_paper":"/paper/math/0409186","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:f7ea90fb90669d1ca547b3b5432c08b59a2e3483e8b848a431d81dd1ffcb1e36","observation_id":"f0270873-4c13-4bb8-a157-054fede2c862","resolution":{"observed_at":"2026-08-09T19:36:17.746061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:18.669614Z","title":"The restricted isometry property and its implications for compressed sensing","venue":null,"work_id":"c960f3a4-d23a-4da3-bc1c-4f12ccc64c6d","year":2008},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.749969Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:b6cd715781bbfba48b129f73ef702e34777bd94bc38f8788f03c0fa611b84b0f","observation_id":"3176bd5c-d616-43ea-b46f-f4d4311541b7","resolution":{"observed_at":"2026-08-09T19:36:18.673079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-09T19:36:17.753623Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.753623Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:35cf996d3f6ce6b640f170b156f34431a38124c2d835ef7db5ca6e7e0373f052","observation_id":"e873054e-003c-4e52-a961-6a883516badd","resolution":{"observed_at":"2026-08-09T19:36:17.753623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-09T19:36:17.757293Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.757293Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:0c35507027d02c5e8c1810f3e5ec76349c8000b597193af6c8ccf91c2119a9d8","observation_id":"565bf59a-aa08-4b5c-b984-8090543af5ee","resolution":{"observed_at":"2026-08-09T19:36:17.757293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-09T19:36:17.761323Z","title":"Qlora: Efficient finetuning of quantized llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.761323Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:33cdc51d7e89cd1b84b2b319a29c1ef7df2d386c947b43d14ef7b90f5513e119","observation_id":"d9155d89-d4a7-4873-aeba-a42b3ed7f3d1","resolution":{"observed_at":"2026-08-09T19:36:17.761323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:17.765020Z","title":"Parameter-efficient fine-tuning of large-scale pre-trained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.765020Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:8a6ab9c50ca22831ca6d64acd23bf4add87a55bd0b36e9204f0fa22c5076fe51","observation_id":"97fcdb8c-9ab9-4957-821c-aba9cb433f1e","resolution":{"observed_at":"2026-08-09T19:36:17.765020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:18.654108Z","title":"Compressed sensing","venue":null,"work_id":"b7a910fd-33a1-4e9e-9174-db1ad0682f2d","year":2006},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.768111Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:dd91997fb0a554767be7356c282d6ac1a3a3123ef939b3f932d6b0823ffff6f8","observation_id":"5befa8c3-693d-47d9-9880-7c5f63b5281c","resolution":{"observed_at":"2026-08-09T19:36:18.657363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T19:36:17.771445Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.771445Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:5d5dc334f2a743449af7dd604ee33e36d96c3c61c1a1afbefd7e8287c67cdd01","observation_id":"3dfbfe69-c703-489b-ad54-0bc353df4bd9","resolution":{"observed_at":"2026-08-09T19:36:17.771445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-09T19:36:17.774791Z","title":"Parameter-efficient fine-tuning for large models: A comprehensive survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.774791Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:a4389931183fb78bbaf0df178012a424f3f6aa37482e121b845a61a7a6b8d3ea","observation_id":"9ad3f6fb-a352-4868-96ce-165fa8fa291f","resolution":{"observed_at":"2026-08-09T19:36:17.774791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-05T09:55:40.815776Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-09T19:36:17.778015Z","title":"Flora: Low-rank adapters are secretly gradient compressors, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.778015Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:b7fe4541d3088de2ba030baf276a76d796fe7b65349ba38a7f26fb120b45165c","observation_id":"41686e11-7732-4b46-90fc-326d16a0dfc8","resolution":{"observed_at":"2026-08-09T19:36:17.778015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12354","last_updated":"2024-07-04T18:33:00Z","snapshot_observed_at":"2026-08-09T05:11:34.661398Z","submitted_at":"2024-02-19T18:33:49Z","title":"LoRA+: Efficient Low Rank Adaptation of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12354","snapshot_observed_at":"2026-08-09T19:36:17.781296Z","title":"Lora+: Efficient low rank adaptation of large models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.781296Z"},"links":{"cited_paper":"/paper/2402.12354","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:1974dea91cf8c9ce7db3ce16acfd9a1a00a462ce29dea85d361983e45032213c","observation_id":"5ffcbcec-0c0b-4b4a-9037-0517cf6b2785","resolution":{"observed_at":"2026-08-09T19:36:17.781296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-09T04:45:04.547249Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-09T19:36:17.784720Z","title":"Towards a unified view of parameter-efficient transfer learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.784720Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:2a5ba7bffcc657012a7728b3276cbf3be25ff94c2da1dd934356f2778fc4a65f","observation_id":"82664719-81a5-4b27-b7f9-20b7b9769820","resolution":{"observed_at":"2026-08-09T19:36:17.784720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00751","last_updated":"2019-06-13T17:48:30Z","snapshot_observed_at":"2026-07-06T07:30:44.870185Z","submitted_at":"2019-02-02T16:29:47Z","title":"Parameter-Efficient Transfer Learning for NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00751","snapshot_observed_at":"2026-08-09T19:36:17.787922Z","title":"Parameter-efficient transfer learning for nlp, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.787922Z"},"links":{"cited_paper":"/paper/1902.00751","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:231a12fb2c3ce2e1b12ada588a462174b2c0ae90ff83d393b96f82252b9b65cf","observation_id":"b9199260-0724-493f-910c-7440023d6314","resolution":{"observed_at":"2026-08-09T19:36:17.787922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T19:36:17.791270Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.791270Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:027ee88ff8ca5b805d2d5a070bc8da07c8784f78f332d16a7c1e5c140d7f97e8","observation_id":"086975dd-83d1-4b71-9038-8d3cc64a7ad2","resolution":{"observed_at":"2026-08-09T19:36:17.791270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01933","last_updated":"2023-10-09T15:38:46Z","snapshot_observed_at":"2026-08-09T04:45:14.956800Z","submitted_at":"2023-04-04T16:31:37Z","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01933","snapshot_observed_at":"2026-08-09T19:36:17.794346Z","title":"Llm-adapters: An adapter family for parameter-efficient fine-tuning of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.794346Z"},"links":{"cited_paper":"/paper/2304.01933","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:8bcae49efc96f97798112d7739e5b5a8fd50da15d1a21301fdaa6397bbf5498f","observation_id":"15ddbe4e-cd0c-4b0e-a589-a0115203258f","resolution":{"observed_at":"2026-08-09T19:36:17.794346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11867","last_updated":"2024-05-28T07:05:05Z","snapshot_observed_at":"2026-07-06T17:32:02.824244Z","submitted_at":"2024-02-19T06:22:09Z","title":"LoRA Training in the NTK Regime has No Spurious Local Minima","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11867","snapshot_observed_at":"2026-08-09T19:36:17.797970Z","title":"Lee, and Ernest K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.797970Z"},"links":{"cited_paper":"/paper/2402.11867","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:eb733c4e62525df6d19d5a83f2baf0e7b4695abe2014d12e97534c958b1fcd4e","observation_id":"f869e641-dcec-47d6-9b42-c81201e5adce","resolution":{"observed_at":"2026-08-09T19:36:17.797970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T19:36:17.801369Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.801369Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:3636388507ce71d7175a42b395b308a77ed8cb6110667316fc1e864a112d63cf","observation_id":"abb5675f-ddcb-4b29-b9bc-07f2faa32034","resolution":{"observed_at":"2026-08-09T19:36:17.801369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11454","last_updated":"2024-01-16T18:59:22Z","snapshot_observed_at":"2026-08-09T04:48:28.604919Z","submitted_at":"2023-10-17T17:59:46Z","title":"VeRA: Vector-based Random Matrix Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11454","snapshot_observed_at":"2026-08-09T19:36:17.804534Z","title":"Kopiczko, Tijmen Blankevoort, and Yuki M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.804534Z"},"links":{"cited_paper":"/paper/2310.11454","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:f273b98a26640c72ad01ccfd7c29b0403b3f92864f0e8fdf22abe54c18a9a149","observation_id":"e8f65eb4-cc9c-485e-9a4d-bbc8718e6ad4","resolution":{"observed_at":"2026-08-09T19:36:17.804534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-09T19:36:17.808167Z","title":"The power of scale for parameter-efficient prompt tuning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.808167Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:2d0b2fc25ead921236db8ed9bbc1457f36ca2a007aac104380ee2b88770588ef","observation_id":"07e24b47-0e72-4b28-b870-144ed38954e7","resolution":{"observed_at":"2026-08-09T19:36:17.808167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-09T19:36:17.811398Z","title":"Prefix-tuning: Optimizing continuous prompts for generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.811398Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:f0097939811834cbf35a1389e006b251eb7ade8ca1b0b909a1937d08b657d7ad","observation_id":"ff7ced89-bc9c-4e65-ad51-d3eb87bf2a72","resolution":{"observed_at":"2026-08-09T19:36:17.811398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12857","last_updated":"2024-08-23T05:54:53Z","snapshot_observed_at":"2026-08-02T03:25:18.261713Z","submitted_at":"2024-08-23T05:54:53Z","title":"Memory-Efficient LLM Training with Online Subspace Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12857","snapshot_observed_at":"2026-08-09T19:36:17.814744Z","title":"Memory-efficient llm training with online subspace descent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.814744Z"},"links":{"cited_paper":"/paper/2408.12857","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:3098a32d597d0a1d4cccac85d8ef7d1763d863be1b375767ed84d0fff08f89ba","observation_id":"6d1fc8ae-5ae8-4910-b94c-4723451ebeef","resolution":{"observed_at":"2026-08-09T19:36:17.814744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-09T19:36:17.818221Z","title":"Dora: Weight-decomposed low-rank adaptation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.818221Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:811749f880f376e9ac57341a81832a21c0d15534f637edfa1f14300fed2fe82f","observation_id":"f4e409d6-bc4b-4f3c-bb62-fbbbbf29ffda","resolution":{"observed_at":"2026-08-09T19:36:17.818221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-10T12:38:42.378782Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-09T19:36:17.821607Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.821607Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:1990f0e36c37969746b8294fe578462b8047e61a211c1c175e0bdff481a20a73","observation_id":"b90e963b-3618-44b8-9275-5b7cd3163ca9","resolution":{"observed_at":"2026-08-09T19:36:17.821607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-09T19:36:17.825287Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.825287Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:c3a069c4663dc7c65f25133a3e35c8e563ef123c6ea4bef961dcecbf03b52a4f","observation_id":"4a77fbeb-75c0-4720-8086-f3bf17189252","resolution":{"observed_at":"2026-08-09T19:36:17.825287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04489","last_updated":"2021-06-08T16:16:40Z","snapshot_observed_at":"2026-08-03T19:17:21.128233Z","submitted_at":"2021-06-08T16:16:40Z","title":"Parameter-efficient Multi-task Fine-tuning for Transformers via Shared Hypernetworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04489","snapshot_observed_at":"2026-08-09T19:36:17.828868Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.828868Z"},"links":{"cited_paper":"/paper/2106.04489","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:d8238fd355f7c35d800f19f83f8d347bb29f7477a6b13e62fc50702d0d74498b","observation_id":"53f3b197-a9d7-4fb6-88a8-6893ff423014","resolution":{"observed_at":"2026-08-09T19:36:17.828868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11046","last_updated":"2024-10-24T03:30:46Z","snapshot_observed_at":"2026-07-06T18:46:43.829115Z","submitted_at":"2024-07-08T12:32:10Z","title":"A Survey on LoRA of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11046","snapshot_observed_at":"2026-08-09T19:36:17.832226Z","title":"A survey on lora of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.832226Z"},"links":{"cited_paper":"/paper/2407.11046","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:b5cabdcb3ee72c5b7e65c87e37224730b3f10a7ef90f35a1525ed51367758c42","observation_id":"d9eb9b1d-d850-487d-9d07-333704c92bba","resolution":{"observed_at":"2026-08-09T19:36:17.832226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:18.643619Z","title":"A review of sparse recovery algorithms","venue":null,"work_id":"7722bfc6-8a19-4a9e-9b15-fcf6c8b81503","year":2018},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.835593Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:e174e1afb45cf088a6094a661f1e6ebbea4ce767eefb74dcffbb149f7978023e","observation_id":"32cc5ac5-9d2a-4f24-bfcd-23f2189d5bb8","resolution":{"observed_at":"2026-08-09T19:36:18.647701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:18.633332Z","title":"Orthogonal matching pursuit: Recursive function approximation with applications to wavelet decomposition","venue":null,"work_id":"b5b2c952-38b9-4864-9358-bc435a93ae80","year":1993},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.838670Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:3fe4f144931c0cef4027b462306716240163edf0b5ac8708ff1de5f1949ce0d3","observation_id":"073f25c4-e3ab-406a-b07c-2c51facf3800","resolution":{"observed_at":"2026-08-09T19:36:18.636894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00247","last_updated":"2021-01-26T12:54:33Z","snapshot_observed_at":"2026-08-09T18:48:57.194984Z","submitted_at":"2020-05-01T07:03:42Z","title":"AdapterFusion: Non-Destructive Task Composition for Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00247","snapshot_observed_at":"2026-08-09T19:36:17.841608Z","title":"Adapterfusion: Non-destructive task composition for transfer learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.841608Z"},"links":{"cited_paper":"/paper/2005.00247","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:499bb5ab8237e64622dbff68e9d96c64dfcb15cc489e9f2b1c148e2e55d991b6","observation_id":"c9da6903-5413-43e9-a894-a760d3e58285","resolution":{"observed_at":"2026-08-09T19:36:17.841608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05445","last_updated":"2024-05-27T09:20:35Z","snapshot_observed_at":"2026-07-06T17:27:15.921312Z","submitted_at":"2024-02-08T06:53:31Z","title":"Accurate LoRA-Finetuning Quantization of LLMs via Information Retention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05445","snapshot_observed_at":"2026-08-09T19:36:17.845075Z","title":"Accurate lora-finetuning quantization of llms via information retention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.845075Z"},"links":{"cited_paper":"/paper/2402.05445","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:a18bfecc235bfe49728c9a9aa0d6ac77f68ff7832f7ce214a518bea5f73d9c7e","observation_id":"10cbf498-dbd3-44eb-a1e0-ce62ed2dff9d","resolution":{"observed_at":"2026-08-09T19:36:17.845075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11875","last_updated":"2024-06-08T03:29:17Z","snapshot_observed_at":"2026-07-06T17:05:06.923713Z","submitted_at":"2023-12-19T06:06:30Z","title":"Sparse is Enough in Fine-tuning Pre-trained Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11875","snapshot_observed_at":"2026-08-09T19:36:17.848341Z","title":"Sparse is enough in fine-tuning pre-trained large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.848341Z"},"links":{"cited_paper":"/paper/2312.11875","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:a505e9041e8cd66a898bc91c1dcf7732889e45ce2b9285125a8b38739893149d","observation_id":"e1906722-64d4-49ad-824f-fa9244388ecb","resolution":{"observed_at":"2026-08-09T19:36:17.848341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.07599","last_updated":"2018-11-28T21:13:10Z","snapshot_observed_at":"2026-07-06T07:03:17.804661Z","submitted_at":"2018-09-20T13:02:14Z","title":"Sparsified SGD with Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.07599","snapshot_observed_at":"2026-08-09T19:36:17.852557Z","title":"Stich, Jean-Baptiste Cordonnier, and Martin Jaggi","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.852557Z"},"links":{"cited_paper":"/paper/1809.07599","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:f4ebe3ab71c175cee7820844c3bf84669bffc08ef091bc63db69f70ee56ce67b","observation_id":"bddf558a-1ba0-4a2c-9c13-7bf580d03ef6","resolution":{"observed_at":"2026-08-09T19:36:17.852557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:17.855812Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.855812Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:7a51728a0f672796945df820f042e3075856b70a63e50459d16aaa04e357c1a7","observation_id":"adcc9dc9-f84b-44b9-b18e-ccd3059dd9d1","resolution":{"observed_at":"2026-08-09T19:36:17.855812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T19:36:17.858941Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.858941Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:75810fba064c77ef6b9b5278251c3b51ec25677e27cbaa9017a6dec6274fd3da","observation_id":"3a5f929b-0fbc-4de4-a96f-c84150bae191","resolution":{"observed_at":"2026-08-09T19:36:17.858941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:17.862154Z","title":"Cg-fedllm: How to compress gradients in federated fune-tuning for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.862154Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:33035f17b433062dbfeb40dfa04b8ffe146951cd5ad7d612475e151fecd1f57b","observation_id":"e386ad5b-b2c5-4547-bc37-eb8e65d52e42","resolution":{"observed_at":"2026-08-09T19:36:17.862154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04151","last_updated":"2024-01-08T14:26:49Z","snapshot_observed_at":"2026-08-09T08:32:45.570035Z","submitted_at":"2024-01-08T14:26:49Z","title":"Chain of LoRA: Efficient Fine-tuning of Language Models via Residual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04151","snapshot_observed_at":"2026-08-09T19:36:17.865189Z","title":"Chain of lora: Efficient fine-tuning of language models via residual learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.865189Z"},"links":{"cited_paper":"/paper/2401.04151","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:5c299b3898e3f8991675dc27f03c3ffc1a420b2f465c778aafa72b6ebfdf9d3f","observation_id":"45e386fb-90c4-46cf-a2be-b0bb72a60b23","resolution":{"observed_at":"2026-08-09T19:36:17.865189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:17.868567Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.868567Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:1359985f114d952638ccf7c45e2ad2fe3fe0ce83624a29e8d9caf9a33d0f1e8a","observation_id":"6d8d5107-4a19-4ef2-905e-5c8785b0054a","resolution":{"observed_at":"2026-08-09T19:36:17.868567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-09T19:36:17.871740Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.871740Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:f0aa5ac15c476283095ef4abecc2d73764effbf2919f3187c072c8989803925e","observation_id":"eedd31d1-607d-45ea-9fb8-130322623808","resolution":{"observed_at":"2026-08-09T19:36:17.871740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-09T19:36:17.874979Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.874979Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:d2395d0ab7c2c993579dcede6da865f98d76a215af9da5fadd858f7a8f671427","observation_id":"2292b965-8f36-4e1d-aaa0-77ac41752a46","resolution":{"observed_at":"2026-08-09T19:36:17.874979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:18.616952Z","title":"Efficient implementations for orthogonal matching pursuit","venue":null,"work_id":"3c859a40-eb60-4e30-9471-4f80f16d31b4","year":2020},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.878491Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:092ec31edb2d215b3f7512e8d553fb3733676f49e23a81d00fadd3d1609cba11","observation_id":"f0d41f64-a43a-4c4f-ad2a-9be61e9bd0a7","resolution":{"observed_at":"2026-08-09T19:36:18.621056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:36:17.881647Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T19:36:17.881647Z"},"links":{"citing_paper":"/paper/2502.00311"},"observation_digest":"sha256:6eb1f00309492801594503ca5d8dcf71a589a58e8b6e3bac20607ee13f74f81d","observation_id":"a385b9dc-d055-4eae-a8d6-18067364d007","resolution":{"observed_at":"2026-08-09T19:36:17.881647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00311","last_updated":"2025-02-01T04:18:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T12:39:07.648073Z","submitted_at":"2025-02-01T04:18:28Z","title":"Sparse Gradient Compression for Fine-Tuning Large Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2502.00311."}