{"as_of":"2026-08-17T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:473d34029bd8553b11262c5f062ef32db706a7ac9b43f083c75a2a8bc705c46e","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:01:42.078459Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.11254/citation-record","integrity":"/paper/2509.11254/integrity","json":"/paper/2509.11254/citation-record.json","paper":"/paper/2509.11254"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.007942Z","title":"Scaling distributed machine learning with the parameter server","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.007942Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:488e5436419c1c29625a3eb70eb6fe67ea22e8bdb73ffe4b6fe6568c4836b025","observation_id":"83872f07-4923-4fbd-b9a1-03f44b2a66f2","resolution":{"observed_at":"2026-08-04T17:01:42.007942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.011004Z","title":"Bandwidth optimal all-reduce algorithms for clusters of workstations.Journal of Parallel and Distributed Computing, 69(2):117–124, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.011004Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:a7f55b326f531ac23a7efa35af4db72eb5703ae5420410b8ece6f5f9773d1ead","observation_id":"d9539af7-b0c0-4af2-8de0-8bd35ea37279","resolution":{"observed_at":"2026-08-04T17:01:42.011004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.014246Z","title":"1-bit stochastic gradient descent and its application to data-parallel distributed training of speech dnns","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.014246Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:4dcaacf85b26945f8e30938c9afa2228ea74ccacf3306b362c4180fc09f35c80","observation_id":"fa0af9d4-aecb-4806-93dc-acd646b067de","resolution":{"observed_at":"2026-08-04T17:01:42.014246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.017193Z","title":"Project adam: Building an efficient and scalable deep learning training system","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.017193Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:b09310a4fdc78be6cde41d1ad366cfeaa13a7de91d8162f8e329a370d1b38d75","observation_id":"8f70ee7f-a8b0-4246-935a-3d8be6330014","resolution":{"observed_at":"2026-08-04T17:01:42.017193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.020282Z","title":"Qsgd: Communication-efficient sgd via gradient quantization and encoding.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.020282Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:edf57087a862b3c64c81dbcbb5861cd5f15b03b64f28ab3c920fc883fd7bbf0a","observation_id":"a9ad12bd-9b49-40d6-a8b1-d79cdc2b55ae","resolution":{"observed_at":"2026-08-04T17:01:42.020282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.023417Z","title":"Terngrad: Ternary gradients to reduce communication in distributed deep learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.023417Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:49afbead72d0835fe33dfa9fff4cb65f61ef5e3c3a15cb7aef34224d9d2b4dda","observation_id":"c090a467-3b2d-4520-b04e-df041fe5ddac","resolution":{"observed_at":"2026-08-04T17:01:42.023417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05492","last_updated":"2017-10-30T20:52:14Z","snapshot_observed_at":"2026-08-13T17:19:46.488095Z","submitted_at":"2016-10-18T09:11:51Z","title":"Federated Learning: Strategies for Improving Communication Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05492","snapshot_observed_at":"2026-08-04T17:01:42.026238Z","title":"Federated learning: Strategies for improving communication efficiency.arXiv preprint arXiv:1610.05492, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.026238Z"},"links":{"cited_paper":"/paper/1610.05492","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:2a948893e703fc52ae67b63fdc7ac3c03e3c3c4325c6ac9aeb5a3fa457560fb4","observation_id":"70983f45-eb54-46d5-a7e9-b4e2e50b3c62","resolution":{"observed_at":"2026-08-04T17:01:42.026238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.029318Z","title":"Gradient sparsification for communication-efficient distributed optimization.Advances in Neural Information Processing Systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.029318Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:14ff931815c05f83eef4b812b114c876822a0028afa5f2c494129a0357265b43","observation_id":"5e083bab-dcb5-48a1-bbde-113d798d832d","resolution":{"observed_at":"2026-08-04T17:01:42.029318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.031993Z","title":"Sparsified sgd with memory.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.031993Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:b4ffe10f0a3a91b107cc48739aefcece15c74c1abbbc41a57cf2d5330710bd65","observation_id":"48c065bf-e9f9-47f4-bc2f-212fd1f91d5f","resolution":{"observed_at":"2026-08-04T17:01:42.031993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.034491Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.034491Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:dc110f451ac6e9314e71aaa9ad14f4e9d560d11169e9a551d67d7bfc8957f01f","observation_id":"7d3beb5f-c2e7-4fcc-871e-a82c46bb0527","resolution":{"observed_at":"2026-08-04T17:01:42.034491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-08-17T03:45:26.402267Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-04T17:01:42.037020Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection.arXiv preprint arXiv:2403.03507, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.037020Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:2f0029c11837bc490c85a81f6d0416ae970619f740127a860cede914bbbc5a38","observation_id":"1a3dd5dc-f83f-4698-8b3f-271a689313bf","resolution":{"observed_at":"2026-08-04T17:01:42.037020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.039844Z","title":"Sltrain: a sparse plus low rank approach for parameter and memory efficient pretraining.Advances in Neural Information Processing Systems, 37:118267–118295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.039844Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:0d3de4a44680b6bf830b70c078b2d8461a99160266e0aac18fb8b7d845d937a7","observation_id":"ad88d29b-8031-4eb9-a05a-f450f1f0e019","resolution":{"observed_at":"2026-08-04T17:01:42.039844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07698","last_updated":"2024-10-10T08:10:53Z","snapshot_observed_at":"2026-08-16T13:10:48.688986Z","submitted_at":"2024-10-10T08:10:53Z","title":"Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank Structures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07698","snapshot_observed_at":"2026-08-04T17:01:42.042592Z","title":"Enhancing zeroth-order fine-tuning for language models with low-rank structures.arXiv preprint arXiv:2410.07698, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.042592Z"},"links":{"cited_paper":"/paper/2410.07698","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:7872923050af59e9fb9d7f8606317bab87fc2e7db8542303ff14bf8be6276d78","observation_id":"95b7e784-4094-479f-b626-8868187e7af5","resolution":{"observed_at":"2026-08-04T17:01:42.042592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.045428Z","title":"Powersgd: Practical low-rank gradient compression for distributed optimization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.045428Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:52c6fca978ede42f72ae54dc2142aac5cc985d84ebfef8e6131b3c1d4eede619","observation_id":"6b27ab68-3b4f-41ab-9af7-1b0c2fe8f4ea","resolution":{"observed_at":"2026-08-04T17:01:42.045428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.048192Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.048192Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:7f76c4b0f47169ded6a33af2e450d7914c64369958efa2af6211d378d2ad1cce","observation_id":"4411f083-7653-4de7-8fea-d230e4f16aee","resolution":{"observed_at":"2026-08-04T17:01:42.048192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02868","last_updated":"2023-03-06T03:36:26Z","snapshot_observed_at":"2026-08-16T15:50:36.516359Z","submitted_at":"2023-03-06T03:36:26Z","title":"Angel-PTM: A Scalable and Economical Large-scale Pre-training System in Tencent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02868","snapshot_observed_at":"2026-08-04T17:01:42.051031Z","title":"Angel- ptm: A scalable and economical large-scale pre-training system in tencent.arXiv preprint arXiv:2303.02868, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.051031Z"},"links":{"cited_paper":"/paper/2303.02868","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:b751b544b1914b23df1ab22f59c3bb1f1af04d216fd7e781668969e7bcd27f3e","observation_id":"8a12f758-da24-43c7-be5d-46f6984f79e3","resolution":{"observed_at":"2026-08-04T17:01:42.051031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.053851Z","title":"Error feedback fixes signsgd and other gradient compression schemes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.053851Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:9e5b11559f72b12318d64fb21de23c54421fa5ad7e89201b39e660a45d82acff","observation_id":"2b48aaf0-3f7c-4f10-a112-c695b0483338","resolution":{"observed_at":"2026-08-04T17:01:42.053851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.003318Z","title":"single-step power iteration","venue":null,"work_id":null,"year":2091},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.003318Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:73aa47231345d40955ab015bbe7fdaa6e49862731b20eac51bc173158dd75c46","observation_id":"638fb470-f9ea-4018-be12-ffd430cfb395","resolution":{"observed_at":"2026-08-04T17:01:42.003318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.056500Z","title":"Ef21: A new, simpler, theoretically better, and practically faster error feedback.Advances in Neural Information Processing Systems, 34:4384–4396, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.056500Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:b6c887a033d9668f367a12fcdf40427a84d9f07230c7dbb69139cdf682552233","observation_id":"81bde3cf-94be-45fb-89bf-8b8cf9e25e79","resolution":{"observed_at":"2026-08-04T17:01:42.056500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.059202Z","title":"Lower bounds and nearly optimal algorithms in distributed learning with communication compression.Advances in Neural Information Processing Systems, 35:18955–18969, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.059202Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:d4ad8fbe6b4e636922aab35a3e4f166f7430f9a9e2213a869720cb7c04a58eb9","observation_id":"5fad0cd2-3d78-43d2-a6af-c9d062d96753","resolution":{"observed_at":"2026-08-04T17:01:42.059202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05350","last_updated":"2021-06-16T15:44:47Z","snapshot_observed_at":"2026-08-14T18:30:33.361056Z","submitted_at":"2019-09-11T20:54:49Z","title":"The Error-Feedback Framework: Better Rates for SGD with Delayed Gradients and Compressed Communication","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05350","snapshot_observed_at":"2026-08-04T17:01:42.061587Z","title":"The error-feedback framework: Better rates for sgd with delayed gradients and compressed communication.arXiv preprint arXiv:1909.05350, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.061587Z"},"links":{"cited_paper":"/paper/1909.05350","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:3118abf44d76d96f03f127c44b0377fdbadb0f859b0db9f4ba6a3380090d2d60","observation_id":"e65ccc3e-13ba-41a3-98b1-4059729db6ff","resolution":{"observed_at":"2026-08-04T17:01:42.061587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.064823Z","title":"Momentum provably improves error feedback!Ad- vances in Neural Information Processing Systems, 36:76444–76495, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.064823Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:41715caf5937bf21ab118eac22745a8c204facb87c2532f1b32e0bbb388fc260","observation_id":"c7395f9c-76d2-4d0c-8269-09c78faacc0a","resolution":{"observed_at":"2026-08-04T17:01:42.064823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.067290Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.067290Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:2d8fbe169240cc9be39a31cb3e8ef10127b3b1345fb3b622e232d2542b0b29aa","observation_id":"16680f9c-4920-4dce-bb4a-12a797d159a6","resolution":{"observed_at":"2026-08-04T17:01:42.067290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.069707Z","title":"Atomo: Communication-efficient learning via atomic sparsification.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.069707Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:dc997552d41001fb00bd2e701b2b41dc1b2a6543c4dfbc913dfcfd2e2ecd966e","observation_id":"e651f1b9-d25d-44b1-8392-24c2c159f715","resolution":{"observed_at":"2026-08-04T17:01:42.069707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.072449Z","title":"Greedy low-rank gradient compression for distributed learning with convergence guarantees.arXiv preprint arXiv:2507.08784, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.072449Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:6dde532e77939fd2096bcb73eef73446dc59cc3747ebe0ca458ee9938244d6d2","observation_id":"80269079-ba91-48c4-918b-88d47f9e1f0c","resolution":{"observed_at":"2026-08-04T17:01:42.072449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11289","last_updated":"2025-06-04T06:11:50Z","snapshot_observed_at":"2026-08-16T15:09:27.647243Z","submitted_at":"2024-10-15T05:16:32Z","title":"Subspace Optimization for Large Language Models with Convergence Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11289","snapshot_observed_at":"2026-08-04T17:01:42.075076Z","title":"NX i=1 (λ(i) t +γ (i) t ) ! A+ NX i=1 β(i) t ! B # C∈span(C), ⇒ ˜Pt =C. Then: Qt = 1 N NX i=1 ∆(i)⊤ t ˜Pt = qt−1 N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.075076Z"},"links":{"cited_paper":"/paper/2410.11289","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:1e5f3a4ce02cdb65d0481b6fbf7d7d34f973e4a7fa4f1d77dec0767aae828d75","observation_id":"ccd0a2ae-c1ed-4255-8051-ae80ee6c9889","resolution":{"observed_at":"2026-08-04T17:01:42.075076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.078459Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.078459Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:5d37d6acb4ef9a4bef44982a4658948f69a20b5be02c9ec52478c05fc53f5e75","observation_id":"3971d6e2-aa22-4d9d-b675-6ac80d1f8972","resolution":{"observed_at":"2026-08-04T17:01:42.078459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-09T11:55:48.689651Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2509.11254."}