{"as_of":"2026-08-16T05:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15120d8ca7f66e2304c5b07ed27b3db9d4dbb88c79ea6999fcbe3b44b663ce75","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:39:14.547983Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06563/citation-record","integrity":"/paper/2608.06563/integrity","json":"/paper/2608.06563/citation-record.json","paper":"/paper/2608.06563"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.239948Z","title":"Deep learning with differential privacy","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.239948Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:7d1ee6e7171c4a5e1eac01a7ef69fd3ca1fcd432f663954c3152c55fb07bb2b2","observation_id":"3822d646-3a0f-42eb-84b6-32daca8bb002","resolution":{"observed_at":"2026-08-15T14:39:14.239948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.244276Z","title":"Federated learning in edge computing: a systematic survey.Sensors, 22(2):450, 2022.(Cited on page 24)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.244276Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:bc31c016d16c33815aad3cf56e73cabde0bd66419ac7e95768f702b48a3951de","observation_id":"600cd291-0063-4844-9da8-36b1fd188b10","resolution":{"observed_at":"2026-08-15T14:39:14.244276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.247870Z","title":"Distributed delayed stochastic optimiza- tion.Advances in neural information processing systems, 24, 2011.(Cited on page 350)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.247870Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:251d16c6de0c8de93cc5b5a0cd7be2368bd6f83c4ee90da27e7040a1efb33f75","observation_id":"273a8dbd-da51-42e0-a1dc-56abce94b229","resolution":{"observed_at":"2026-08-15T14:39:14.247870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.13255","last_updated":"2020-12-22T07:42:30Z","snapshot_observed_at":"2026-08-14T01:48:39.766084Z","submitted_at":"2020-12-22T07:42:30Z","title":"Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13255","snapshot_observed_at":"2026-08-15T14:39:14.251062Z","title":"Intrinsic dimen- sionality explains the effectiveness of language model fine-tuning.arXiv preprint arXiv:2012.13255, 2020.(Cited on page 131)","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.251062Z"},"links":{"cited_paper":"/paper/2012.13255","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:db905b9106fc074480e4fdf22344c25279bf39cbdb60292e60927a1f6a797482","observation_id":"c037580d-f24e-4570-9790-0529512d6d44","resolution":{"observed_at":"2026-08-15T14:39:14.251062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.255038Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.255038Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:3dc3f2f2a42f652e84edb5330aeba69c9dbed905d2fbdc6aab56af3c3a7c0fb8","observation_id":"ce1f0373-7106-4b05-a835-fd2e8aded92d","resolution":{"observed_at":"2026-08-15T14:39:14.255038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.00051","last_updated":"2021-05-09T19:49:46Z","snapshot_observed_at":"2026-08-13T17:59:32.644760Z","submitted_at":"2020-07-31T19:37:59Z","title":"On the Convergence of SGD with Biased Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.00051","snapshot_observed_at":"2026-08-15T14:39:14.258448Z","title":"On the convergence of SGD with biased gradients.arXiv preprint arXiv:2008.00051, 2020.(Cited on page 350)","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.258448Z"},"links":{"cited_paper":"/paper/2008.00051","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:8afdafaf62b315e571372fc7dbd1cc62c347944d0f1e987fe32a6faf237057d1","observation_id":"083da089-c0d7-4c23-aade-eb09445b5529","resolution":{"observed_at":"2026-08-15T14:39:14.258448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.262286Z","title":"QSGD: Communication-efficient SGD via gradient quantization and encoding","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.262286Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:75b17b94451197d24301e4dcb4bbd10858fc66ab7817dc48c0b2ceffd69a5717","observation_id":"373f3b4e-67df-40f0-b582-71335b705a37","resolution":{"observed_at":"2026-08-15T14:39:14.262286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.265782Z","title":"Byzantine stochastic gradi- ent descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.265782Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:a96709fb4f10d5e0f150b5e02ded1366888e4e464de9f33f448b055e5cb5b44f","observation_id":"aecb71cf-1f76-4a56-8dd4-ed5a8d4b214a","resolution":{"observed_at":"2026-08-15T14:39:14.265782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.268733Z","title":"The convergence of sparsified gradient methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.268733Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:35989e70a3f7e28d6479b2f9e2e5263a1e290ea84f21b7c87473545af73c7cf8","observation_id":"2d5ba978-feaa-4f67-909f-804e58013d64","resolution":{"observed_at":"2026-08-15T14:39:14.268733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.271324Z","title":"Byzantine-resilient non-convex stochastic gradient descent","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.271324Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:bc200f0c6682004f491891bc091b2c704a718e01ce28a86c6d796ad927d6d6a6","observation_id":"301963da-b610-40e3-b1f0-bb884db3d823","resolution":{"observed_at":"2026-08-15T14:39:14.271324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.273868Z","title":"Fixing by mixing: A recipe for optimal byzantine ml under heterogeneity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.273868Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:bc5119de9f40214658c0de19cd552413d0d181fb6ddf4c24c1896a106a6a6e24","observation_id":"59c7da2c-b3c0-4aee-a554-e677efd1fa34","resolution":{"observed_at":"2026-08-15T14:39:14.273868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12780","last_updated":"2024-06-10T13:43:21Z","snapshot_observed_at":"2026-08-15T17:20:11.755620Z","submitted_at":"2024-02-20T07:40:11Z","title":"Byzantine-Robust Federated Learning: Impact of Client Subsampling and Local Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12780","snapshot_observed_at":"2026-08-15T14:39:14.276427Z","title":"Tackling byzantine clients in federated learning.arXiv preprint arXiv:2402.12780, 2024a.(Cited on page 119)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.276427Z"},"links":{"cited_paper":"/paper/2402.12780","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:c94592cefe640d4e4d5e3c8c4368aae8a79dcfd4718de524f99bb8b820350662","observation_id":"f31d589e-462b-494e-935f-b28a49059d6f","resolution":{"observed_at":"2026-08-15T14:39:14.276427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.279479Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.279479Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:1e924e08de13c32d61502047f9aa2f22f55ea5e82e87feff375d1b039a8239c9","observation_id":"29787a14-b3c9-4a28-8e99-d22cd4814ae6","resolution":{"observed_at":"2026-08-15T14:39:14.279479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.282022Z","title":"Federated learning for healthcare: Systematic review and architecture proposal.ACM Transactions on Intel- ligent Systems and Technology (TIST), 13(4):1–23, 2022.(Cited on page 104)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.282022Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:e1f5a67f02736fddc0d6be30a681c328da02a44b663856eede08b8de1787d04f","observation_id":"8b68e4f2-6608-49ce-9237-5136c45f2cda","resolution":{"observed_at":"2026-08-15T14:39:14.282022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.284694Z","title":"Communication complexity of distributed convex learning and optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.284694Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:79eb60a8cf629b4e60ebf6696dd307988e376ef02c2b9b88f9242a61acafdb93","observation_id":"f6142c0f-3921-4caa-ac43-5caaf7bd4c2e","resolution":{"observed_at":"2026-08-15T14:39:14.284694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.288012Z","title":"Lower bounds for non-convex stochastic optimiza- tion.Mathematical Programming, 199(1-2):165–214, 2023.(Cited on pages 123 and 125)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.288012Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:f2ef934dd169a3d995ddd4ac2165adb2bb255e63f8821580de8354f14268fde2","observation_id":"ba4ce198-d626-45f5-9f00-7ba3180ebecb","resolution":{"observed_at":"2026-08-15T14:39:14.288012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.08894","last_updated":"2021-05-27T06:41:45Z","snapshot_observed_at":"2026-08-03T13:43:52.031121Z","submitted_at":"2021-03-16T07:32:58Z","title":"Distributed Deep Learning Using Volunteer Computing-Like Paradigm","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.08894","snapshot_observed_at":"2026-08-15T14:39:14.291333Z","title":"Distributed deep learning using volunteer computing-like paradigm.arXiv preprint arXiv:2103.08894, 2021.(Cited on page 117)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.291333Z"},"links":{"cited_paper":"/paper/2103.08894","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:61a6f9a908469b31676af978a7e63b475659859ae8cf7a76bd571bfe8605fae8","observation_id":"1f5de97c-06ab-4259-b31e-0784aa000f6d","resolution":{"observed_at":"2026-08-15T14:39:14.291333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.294822Z","title":"A little is enough: Cir- cumventing defenses for distributed learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.294822Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:d9e9bb0f11c92b378bbefb0241eb8098891e13fc3218527d3757f239c1532c50","observation_id":"5a5dfccd-b09a-4827-a168-34c457a765a7","resolution":{"observed_at":"2026-08-15T14:39:14.294822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.297750Z","title":"Qsparse- local-SGD: Distributed SGD with quantization, sparsification and local computations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.297750Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:027556afd5294402393909552285d93d92733e5ba3bf4da7808c32e1e5c37810","observation_id":"9e06ae32-c56e-46f3-bb57-4729b0bcdf14","resolution":{"observed_at":"2026-08-15T14:39:14.297750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.300706Z","title":"Generalized mono- tone operators and their averaged resolvents.Mathematical Programming, 189(1):55–74, 2021.(Cited on page 49)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.300706Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:59a8000ce9c5a8f9d9448715cdb86c306e567b6741916a22a7f6a0f64af4a769","observation_id":"a6c75a6d-950e-40b4-a300-481cb8f2c167","resolution":{"observed_at":"2026-08-15T14:39:14.300706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.303826Z","title":"MOS-SIAM Series on Optimization, 2017.(Cited on pages 43 and 63)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.303826Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:d6fc89043b07eb4053d47772d8dcb7f066a81bb2dbca8c08b74fd912be5acf8d","observation_id":"b852965a-fc8f-4d71-9147-18ad2490ff35","resolution":{"observed_at":"2026-08-15T14:39:14.303826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.306845Z","title":"Demystifying parallel and distributed deep learning: An in-depth concurrency analysis.ACM Computing Surveys (CSUR), 52(4):1–43, 2019.(Cited on page 23)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.306845Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:b706c77f2b21b8043a533055d4a2ca0ebe98ff2e2aef9b2a7f19e8e3adae7075","observation_id":"b165bf5a-a6db-4fe1-9f22-1c7edd7a663d","resolution":{"observed_at":"2026-08-15T14:39:14.306845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.309975Z","title":"Practical recommendations for gradient-based training of deep architectures","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.309975Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:2623a839def53f8be9b9a9cb29cdb4aafb344adc18ef2d0b750a18d3b50bb473","observation_id":"de813356-f3cb-4d2a-b44a-f10c77aeaacd","resolution":{"observed_at":"2026-08-15T14:39:14.309975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05291","last_updated":"2019-02-22T19:55:48Z","snapshot_observed_at":"2026-08-14T18:15:53.973316Z","submitted_at":"2018-10-11T23:50:32Z","title":"signSGD with Majority Vote is Communication Efficient And Fault Tolerant","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05291","snapshot_observed_at":"2026-08-15T14:39:14.313033Z","title":"signsgd with majority vote is communication efficient and byzantine fault tolerant.arXiv preprint arXiv:1810.05291, 2018.(Cited on page 350)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.313033Z"},"links":{"cited_paper":"/paper/1810.05291","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:88d5de95b468d5f1aed50ace8ce7b5a6e3bcd998db9244528ed83e0116b6c495","observation_id":"0230b716-1afc-4184-80bb-fa3e79711ee2","resolution":{"observed_at":"2026-08-15T14:39:14.313033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.317457Z","title":"Incremental proximal methods for large scale convex optimization.Mathematical Programming, 129(2):163–195, 2011.(Cited on page 423)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.317457Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:346c1695b9f62fdc56aea7223325f504abd25f0cbf6d93f005af625fe31147e2","observation_id":"a5b19f17-f587-4c0a-b44c-66b1decba71e","resolution":{"observed_at":"2026-08-15T14:39:14.317457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.320477Z","title":"On biased compression for distributed learning.Journal of Machine Learning Research, 24(276):1–50, 2023.(Cited on pages 114, 121, 269, and 350)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.320477Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:4641a7a7420858d304d8d154dc415757321a2c80cdc7ea2b9736973ebef62bcc","observation_id":"9f66fa8c-92c2-41e0-9495-383763095f74","resolution":{"observed_at":"2026-08-15T14:39:14.320477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-08-13T00:06:55.915196Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-08-15T14:39:14.323602Z","title":"LoRA learns less and forgets less.arXiv preprint arXiv:2405.09673, 2024.(Cited on page 132)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.323602Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:ab9a1cf5aa246eac37bedc55d081b811995862caa13335572edbc7a1b23e0468","observation_id":"3062fa6c-744f-4f90-bb04-56cdb9857e29","resolution":{"observed_at":"2026-08-15T14:39:14.323602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.327099Z","title":"Machine learning with adversaries: Byzantine tolerant gradient descent","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.327099Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:d4365b6d873a3771cbc2a3819f55b5e92a03f3730b6e86ec10300e7a80f77439","observation_id":"b4ad7a4b-43f2-4639-8271-e0aaaa85dd90","resolution":{"observed_at":"2026-08-15T14:39:14.327099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.330265Z","title":"Brendan McMahan, Sarvar Patel, Daniel Ramage, Aaron Segal, and Karn Seth","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.330265Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:21a11ddf36e31cac9d8f2260ed4840db4b61cbfe73d1757209460d3279f5f114","observation_id":"c9585973-869d-45a4-ba77-0788aebf6169","resolution":{"observed_at":"2026-08-15T14:39:14.330265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.333254Z","title":"Towards federated learning at scale: System design.Proceedings of machine learning and systems, 1:374–388, 2019.(Cited on page 24)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.333254Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:d695210df522c69f50773872684bb308443fb22e539c388cb3f5ef6e96146b45","observation_id":"957d9540-c62c-44bf-bdd1-a95b219de095","resolution":{"observed_at":"2026-08-15T14:39:14.333254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.336427Z","title":"Curiously fast convergence of some stochastic gradient descent algorithms","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.336427Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:f455a96c658a95fed8d2884c7f97c18edfd0f413e05adbcde1b360e3974a1686","observation_id":"e30da65c-2b94-42e6-bb85-7a67ccc691ee","resolution":{"observed_at":"2026-08-15T14:39:14.336427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.339648Z","title":"Democratizing machine learning: Resilient distributed learning with heterogeneous participants","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.339648Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:8b2b17c4883127cf68e9a40eb3c46a7d9cc6c9921d9fbcaa86943755a85c2f0f","observation_id":"bd92d279-3d4b-4eb3-b21a-97ffd506b1c4","resolution":{"observed_at":"2026-08-15T14:39:14.339648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.343167Z","title":"Minibatch stochastic three points method for unconstrained smooth minimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.343167Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:bcf177de0568688069f65ac9b31ff8a3debfdcb6d8a4506675b2a8054d7c1ba9","observation_id":"a60a09f8-7400-43b9-bc1d-66facd631b4b","resolution":{"observed_at":"2026-08-15T14:39:14.343167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.345640Z","title":"Flpytorch: optimization research simulator for federated learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.345640Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:65a954eae086fc70d41cbe67a3ddac15e6c355eb9974d8e044e62feb39482f83","observation_id":"98845fd0-8120-4089-adf0-e318fa4a6c53","resolution":{"observed_at":"2026-08-15T14:39:14.345640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.348090Z","title":"Tighter lower bounds for shuffling SGD: Random permutations and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.348090Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:a4aa1b56c91048bed91de10c7ea6781671e72fdcc791065c82b97a51dd501198","observation_id":"0600f874-9cad-4c69-92ae-0d1881f37a5a","resolution":{"observed_at":"2026-08-15T14:39:14.348090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.350708Z","title":"A first-order primal-dual algorithm for convex problems with applications to imaging.Journal of Mathematical Imaging and Vision, 40(1):120–145, 2011.(Cited on page 78)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.350708Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:e0b0fce3295577d2bf20b839836996655300a1b5c0be680b7edefc9d47ca405f","observation_id":"1e351160-cffb-4db7-9861-b02bd68a115d","resolution":{"observed_at":"2026-08-15T14:39:14.350708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.353739Z","title":"LIBSVM: A library for support 151 vector machines.ACM transactions on intelligent systems and technology (TIST), 2(3):1–27, 2011.(Cited on pages 57, 71, 87, 102, 129, and 269)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.353739Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:38f2e81e7673b9f166912f34606d90e39a9ef15b614fe9f35fe7419157f18ab7","observation_id":"af79b4c7-4815-4ca3-b09c-ceedc52d1cb4","resolution":{"observed_at":"2026-08-15T14:39:14.353739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00878","last_updated":"2020-07-02T04:45:55Z","snapshot_observed_at":"2026-08-10T13:40:17.085827Z","submitted_at":"2020-07-02T04:45:55Z","title":"On the Outsized Importance of Learning Rates in Local Update Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00878","snapshot_observed_at":"2026-08-15T14:39:14.356201Z","title":"On the outsized importance of learn- ing rates in local update methods.arXiv preprint arXiv:2007.00878, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.356201Z"},"links":{"cited_paper":"/paper/2007.00878","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:a283d462830ffa516887a161f9b6e777bff4b36f9053b4055df3948f1e069c68","observation_id":"63122e3e-f66f-4d91-b03e-1042ccb195b2","resolution":{"observed_at":"2026-08-15T14:39:14.356201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07820","last_updated":"2021-06-15T00:40:40Z","snapshot_observed_at":"2026-08-16T04:12:58.564788Z","submitted_at":"2021-06-15T00:40:40Z","title":"On Large-Cohort Training for Federated Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07820","snapshot_observed_at":"2026-08-15T14:39:14.358958Z","title":"On large-cohort training for federated learning.arXiv preprint arXiv:2106.07820, 2021.(Cited on pages 60 and 90)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.358958Z"},"links":{"cited_paper":"/paper/2106.07820","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:86641d4c14dbadc16778f8cc4308901bd4805d31669484c4a31c14200f578652","observation_id":"072b9a17-ffaf-4c27-a479-6a3ba9ea0f6a","resolution":{"observed_at":"2026-08-15T14:39:14.358958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.362756Z","title":"Draco: Byzantine-resilient distributed training via redundant gradi- ents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.362756Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:a15416adaf641b9e3759c214fd653c7c8e95fc292994d13ba608fc24ba159a6a","observation_id":"8e6bc20e-b4c4-44db-842a-0bde68b49562","resolution":{"observed_at":"2026-08-15T14:39:14.362756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.365724Z","title":"A primal–dual fixed point algorithm for convex separable minimization with applications to im- age restoration.Inverse Problems, 29(2):025011, 2013.(Cited on page 186)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.365724Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:040789d4cf38d32e062fc9764faded8d10467a83a758ddee33d56e98eccafe32","observation_id":"30a75e98-f211-456d-9b9e-64a8eb716522","resolution":{"observed_at":"2026-08-15T14:39:14.365724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.368718Z","title":"Optimal client sampling for federated learning.Privacy Preserving Machine Learning (NeurIPS 2020 Workshop), 2020a.(Cited on pages 27, 30, 60, 75, and 90)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.368718Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:c4ef767ba3db072ddea4b2c16e5bcad696b4c45fe7de8429162ff58bd3e0d82f","observation_id":"37c625f0-09de-431d-9476-77e7106427f5","resolution":{"observed_at":"2026-08-15T14:39:14.368718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.371598Z","title":"Understanding gradient clipping in private SGD: A geometric perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.371598Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:a76a8aef5e3141a0b2661e9f668bf37719fc0942db46409aa1f34fcb6fba53ef","observation_id":"f9977c3c-9fb0-441d-97d2-3479dc7fcbf1","resolution":{"observed_at":"2026-08-15T14:39:14.371598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.374737Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.374737Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:f715ced7283cb79ecff96c4ac4fc30f9f455702bf0f64d504fc7060938815ad9","observation_id":"2681aab6-511b-439d-a6e5-2354dd99b915","resolution":{"observed_at":"2026-08-15T14:39:14.374737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01243","last_updated":"2020-10-03T01:04:17Z","snapshot_observed_at":"2026-08-09T04:56:08.266143Z","submitted_at":"2020-10-03T01:04:17Z","title":"Client Selection in Federated Learning: Convergence Analysis and Power-of-Choice Selection Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01243","snapshot_observed_at":"2026-08-15T14:39:14.378853Z","title":"Client selection in feder- ated learning: Convergence analysis and power-of-choice selection strate- gies.arXiv preprint arXiv:2010.01243, 2020.(Cited on pages 30 and 60)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.378853Z"},"links":{"cited_paper":"/paper/2010.01243","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:369752712eb94119a3ef2967eae312a1e11d02de293f09fdb8e0f92ec358d6b8","observation_id":"0ecbaf52-b436-45a3-88a4-b2f6926b5d19","resolution":{"observed_at":"2026-08-15T14:39:14.378853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.382252Z","title":"On the convergence of federated averaging with cyclic client participation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.382252Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:5c93d48390ea67d811afd8c78d6d3f20bde6ee12cd77074a1973536ac41fdd46","observation_id":"2895380d-d36c-43d6-b151-26b1873483a6","resolution":{"observed_at":"2026-08-15T14:39:14.382252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.385306Z","title":"Emerging trends: A gentle introduction to fine-tuning.Natural Language Engineering, 27(6): 763–778, 2021.(Cited on page 131)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.385306Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:56e9441dfa14c403f4c8f362a33495e80b6172154d0c6083164bda6ca75be474","observation_id":"3ec6e413-538c-40d6-8e82-12141ebaaff4","resolution":{"observed_at":"2026-08-15T14:39:14.385306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.388427Z","title":"Proximal splitting methods in signal processing","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.388427Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:95271c3a5dcef1069748273ab25ef80fd6fc1bd32c10fc13aee175b05ba89768","observation_id":"ac78e289-b439-4779-aa56-19590cd47797","resolution":{"observed_at":"2026-08-15T14:39:14.388427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.391372Z","title":"Combettes, Laurent Condat, Jean-Christophe Pesquet, and B˘ ang C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.391372Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:6f6b1e0ecce2cd72c081da2ca4b4e0ced1765493789fc4330f24753522a8502a","observation_id":"a0fb944f-5fa1-44ae-9486-16bd55422fe8","resolution":{"observed_at":"2026-08-15T14:39:14.391372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03056","last_updated":"2023-03-06T13:39:15Z","snapshot_observed_at":"2026-08-13T19:09:18.648659Z","submitted_at":"2021-06-06T07:39:01Z","title":"MURANA: A Generic Framework for Stochastic Variance-Reduced Optimization","version":3},"cited_work":{"arxiv_id":"2106.03056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.03056","snapshot_observed_at":"2026-08-15T14:39:16.718895Z","title":"MURANA: A Generic Framework for Stochastic Variance-Reduced Optimization","venue":"math.OC","work_id":"3ebdbece-2d84-4c47-ae1d-32f53a3b913e","year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.394303Z"},"links":{"cited_paper":"/paper/2106.03056","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:1e4f5c04a55d60935b70963ddd1c112e0629c6a39de361222a9bc7da4ef23b1d","observation_id":"6e99eb70-a8bf-4b0a-8c2d-1a7f4a1bcb57","resolution":{"observed_at":"2026-08-15T14:39:16.722949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12891","last_updated":"2023-03-07T06:50:23Z","snapshot_observed_at":"2026-08-13T14:56:57.121509Z","submitted_at":"2022-07-26T13:37:21Z","title":"RandProx: Primal-Dual Optimization Algorithms with Randomized Proximal Updates","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12891","snapshot_observed_at":"2026-08-15T14:39:14.397597Z","title":"RandProx: Primal-dual opti- mization algorithms with randomized proximal updates.arXiv preprint arXiv:2207.12891, 2022.(Cited on pages 77, 78, 80, and 437)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.397597Z"},"links":{"cited_paper":"/paper/2207.12891","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:3537f3449eaa9d0feabd20892aef04d6abd40c052dda7915ffecad8ea2a3ea98","observation_id":"8e8c59c8-18b3-4542-8759-5828255fd41f","resolution":{"observed_at":"2026-08-15T14:39:14.397597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.00137","last_updated":"2023-02-24T08:24:22Z","snapshot_observed_at":"2026-08-12T05:38:51.036207Z","submitted_at":"2019-11-30T06:06:08Z","title":"Proximal Splitting Algorithms for Convex Optimization: A Tour of Recent Advances, with New Twists","version":8},"cited_work":{"arxiv_id":"1912.00137","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.00137","snapshot_observed_at":"2026-08-15T14:39:16.696419Z","title":"Proximal Splitting Algorithms for Convex Optimization: A Tour of Recent Advances, with New Twists","venue":"math.OC","work_id":"5aa56992-8f57-4208-a26f-b02cdeec4ea1","year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.400811Z"},"links":{"cited_paper":"/paper/1912.00137","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:4bcf67bc2044bb2e764bc910f2f0c7dcad618b69b98a6e896e65d4dd09a21fa1","observation_id":"20e41091-570e-4177-b2f7-384b14a15fea","resolution":{"observed_at":"2026-08-15T14:39:16.700545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.403779Z","title":"Distributed proximal splitting algorithms with rates and acceleration.Frontiers in Sig- nal Processing, page 12, 2022.(Cited on page 186)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.403779Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:0069e07857c8e574c33c6e90aba263bf9a0524607dc0276b209ac1a001fdb836","observation_id":"ec2b8597-2075-47c3-a425-2b96969b4706","resolution":{"observed_at":"2026-08-15T14:39:14.403779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09832","last_updated":"2026-06-07T11:57:20Z","snapshot_observed_at":"2026-08-13T12:41:42.452544Z","submitted_at":"2023-02-20T08:37:44Z","title":"TAMUNA: Doubly Accelerated Distributed Optimization under Partial Participation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09832","snapshot_observed_at":"2026-08-15T14:39:14.406150Z","title":"TAMUNA: Doubly accelerated federated learning with local training, com- pression, and partial participation.arXiv preprint arXiv:2302.09832, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.406150Z"},"links":{"cited_paper":"/paper/2302.09832","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:3e47f2bbead01b34e296b7f5bcaae819f1968f0d8e42caca7b982098358d7b14","observation_id":"4d263ad1-c0ef-4183-aca2-2959d032467d","resolution":{"observed_at":"2026-08-15T14:39:14.406150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.409008Z","title":"Importance sampling for minibatches","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.409008Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:243e5e17fc5289baf670b981923945d3edc7be934431e8a16bd5d5868e448b8b","observation_id":"3bf18e55-5419-46ef-8ce3-0c236088da1d","resolution":{"observed_at":"2026-08-15T14:39:14.409008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.412140Z","title":"Momentum-based variance re- duction in non-convex SGD","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.412140Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:97f7d727dcd3cbc62d4b8b5509de6dd2cb28c7195ff9d333d23a2cd7bd6f6d99","observation_id":"7099af46-8835-4d4c-9019-3304609c4b70","resolution":{"observed_at":"2026-08-15T14:39:14.412140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.415902Z","title":"Asynchronous byzantine machine learning (the case of sgd)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.415902Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:11f4522c703df474f9d2a05d1f9a1710bef2a997bd7932ad8619e8f79edcc199","observation_id":"cd868ca3-fa3f-4930-9a79-88d61e34c5f8","resolution":{"observed_at":"2026-08-15T14:39:14.415902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.419207Z","title":"Aggregathor: Byzantine machine learn- ing via robust gradient aggregation.Proceedings of Machine Learning and Systems, 1:81–106, 2019.(Cited on page 118)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.419207Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:6df9285b00d9f24f008e9a57df5bbeb54b9aa2cea151351acadd34c2f75732e2","observation_id":"57402cd9-959f-4e8b-892d-4bff3054207f","resolution":{"observed_at":"2026-08-15T14:39:14.419207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.423242Z","title":"Re- cent theoretical advances in non-convex optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.423242Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:7a14ad07723977b880d38b08641fbf40b1a5714cc5dcd8b6061e2a1be1016565","observation_id":"329717b0-9cbb-433d-a0f1-4589a9a892d5","resolution":{"observed_at":"2026-08-15T14:39:14.423242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.426304Z","title":"Byzantine-resilient high-dimensional SGD with local iterations on heterogeneous data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.426304Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:9c564e4cf59b792898de6a8d957e0bfdad480c0529ef0999f3a15c2ae9f92979","observation_id":"803df5b7-9039-456f-853f-4d31c653f279","resolution":{"observed_at":"2026-08-15T14:39:14.426304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.429487Z","title":"A three-operator splitting scheme and its optimization applications.Set-Val","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.429487Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:b41bf9493813a56852bdc02a6ba55667935d7d9f8208a21a4d1ba99ef629606f","observation_id":"102ae155-77d6-43fc-a40f-522a77bf53a4","resolution":{"observed_at":"2026-08-15T14:39:14.429487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.432520Z","title":"Large scale distributed deep networks.Advances in neural information processing systems, 25, 2012.(Cited on page 23)","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.432520Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:43dfd5e6d3320be7bc1348f2cb6999588fd625614eb8de665c103f71dd50988b","observation_id":"b93ec3c9-dbcf-4e32-8523-790d594ac15f","resolution":{"observed_at":"2026-08-15T14:39:14.432520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.435614Z","title":"A simple practical accelerated method for finite sums.29th Conference on Neural Information Processing Systems (NeurIPS), 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.435614Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:fa4ffb97e1b3bcd9ddb4503b342c75983525f3f8640061d9514ce63184d2cc76","observation_id":"413550d4-17cc-483f-8013-2dbb524a043f","resolution":{"observed_at":"2026-08-15T14:39:14.435614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.438473Z","title":"On the ineffectiveness of variance reduced optimization for deep learning.Advances in Neural Information Processing Systems, 32, 2019.(Cited on page 129)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.438473Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:ef19e698b1029786dd356a9e6b5bd4656d7cefd77339a1fc091d273f505455a4","observation_id":"2917509a-abef-4645-a5df-2bce3add0361","resolution":{"observed_at":"2026-08-15T14:39:14.438473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.441391Z","title":"SAGA: A fast incremental gradient method with support for non-strongly convex com- posite objectives","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.441391Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:9ce177134ece193076fe093b1ad904b8fe300b797a1862d72c32797471389ebb","observation_id":"f3d76e7f-4cca-4c8d-91a4-b90f38acbfce","resolution":{"observed_at":"2026-08-15T14:39:14.441391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.444400Z","title":"Optimal dis- tributed online prediction using mini-batches.Journal of Machine Learning Research, 13(1):165–202, January 2012.(Cited on pages 30 and 53)","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.444400Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:7757b8a153842c984a17e5ed918dfd07859f1895b52210b9ac7c7eb236583456","observation_id":"d10e0071-7c9c-4dfd-8171-356b2a73873c","resolution":{"observed_at":"2026-08-15T14:39:14.444400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.447341Z","title":"Mast: Model-agnostic sparsified training.arXiv preprint arXiv:2311.16086, 2023a.(Cited on page 39)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.447341Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:feeafe4680099bd00aa8f352e2c440c3151bb098b8bd227ae5c4ec93db52382e","observation_id":"8c362c72-a511-4beb-9e96-b96c0a3d9663","resolution":{"observed_at":"2026-08-15T14:39:14.447341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.451515Z","title":"A guide through the Zoo of biased SGD","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.451515Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:252e84549a026c502e0be10769cb63b8cac384f399aedf1d36c67b75526378fc","observation_id":"701a9742-b520-49ef-bed8-3fb7dbafbe82","resolution":{"observed_at":"2026-08-15T14:39:14.451515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06677","last_updated":"2024-03-11T12:49:37Z","snapshot_observed_at":"2026-08-13T00:57:41.419989Z","submitted_at":"2024-03-11T12:49:37Z","title":"Streamlining in the Riemannian Realm: Efficient Riemannian Optimization with Loopless Variance Reduction","version":1},"cited_work":{"arxiv_id":"2403.06677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06677","snapshot_observed_at":"2026-08-15T14:39:16.597761Z","title":"Streamlining in the Riemannian Realm: Efficient Riemannian Optimization with Loopless Variance Reduction","venue":"cs.LG","work_id":"fe264af9-86fb-43bb-bd5a-8a1a52606d66","year":2024},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.454654Z"},"links":{"cited_paper":"/paper/2403.06677","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:e3d7e8f3436474fb1d3eba0b8f82d431c9093ffd232dcd716be619112c3acdc0","observation_id":"a8dc9673-dca5-4fa6-9fa7-52710fde2d31","resolution":{"observed_at":"2026-08-15T14:39:16.601338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02781","last_updated":"2025-04-11T10:52:32Z","snapshot_observed_at":"2026-08-11T23:04:44.996769Z","submitted_at":"2024-12-03T19:20:56Z","title":"Methods with Local Steps and Random Reshuffling for Generally Smooth Non-Convex Federated Optimization","version":3},"cited_work":{"arxiv_id":"2412.02781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02781","snapshot_observed_at":"2026-08-15T14:39:16.584831Z","title":"Methods with Local Steps and Random Reshuffling for Generally Smooth Non-Convex Federated Optimization","venue":"math.OC","work_id":"02b3176a-3fc0-4268-b58d-6a7a49f03904","year":2024},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.458028Z"},"links":{"cited_paper":"/paper/2412.02781","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:61dafd7927d9c600f928ecd921ccc81fd3b2540cf4a7bf07dd1061d31382a1eb","observation_id":"3a9c108e-17e0-4d89-ae90-aadf73cd8384","resolution":{"observed_at":"2026-08-15T14:39:16.588570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.461988Z","title":"Distributed deep learning in open collaborations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.461988Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:c80a02e40dbb33184959f51fbfed459cc67bebffcc83ced702ec9fafe8e143b2","observation_id":"e7692ab1-8f9e-4c32-a8b3-95141eb679c7","resolution":{"observed_at":"2026-08-15T14:39:14.461988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.464980Z","title":"A simple algorithm for a class of nonsmooth convex–concave saddle-point problems.Operations Research Letters, 43(2):209–214, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.464980Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:200b8246a3421044d53f6190d7872457b84e4f706304bcc8a0725b9379c4f3b0","observation_id":"90513fe8-1277-41db-864d-8bd872bb7169","resolution":{"observed_at":"2026-08-15T14:39:14.464980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.467374Z","title":"The algorithmic foundations of differential privacy.Foundations and trends®in theoretical computer science, 9(3-4): 211–487, 2014.(Cited on pages 23, 26, and 28)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.467374Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:7525379e2ebee744d1dbf0dc2213e94a73ba79f428bbfbfa3575037053fb4890","observation_id":"5e2942f1-3b96-4683-81fc-969d60ec853d","resolution":{"observed_at":"2026-08-15T14:39:14.467374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.469835Z","title":"Cali- brating noise to sensitivity in private data analysis","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.469835Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:0a0e1f3ccd566c0931c8bbbac84a871bded453d70633b3fcfb948ad20c4d4953","observation_id":"462db7c5-f08d-4a75-8279-31b0a9fa18ee","resolution":{"observed_at":"2026-08-15T14:39:14.469835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.472283Z","title":"Eichner, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.472283Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:03416cfee09ef9f93c77190c08a0c4ea0ccedaf56ea42286791af1da1b9c0cd8","observation_id":"845998f0-7c53-43fd-8211-0740d797255f","resolution":{"observed_at":"2026-08-15T14:39:14.472283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.474648Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.474648Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:8841fd67a091d7a96c979b4db7be64bea4308b7272f7ab2221b3cdf763df82a6","observation_id":"ede8a3ce-054f-4b48-8df5-e4070b01e7d0","resolution":{"observed_at":"2026-08-15T14:39:14.474648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.477164Z","title":"Spider: Near- optimal non-convex optimization via stochastic path-integrated differential estimator","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.477164Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:d1881ee13d362633e10d0818f0aa92ca6d3fc59cbd6c7659b0b89708d6f31e45","observation_id":"a5277e9b-2d54-4ca2-b023-afec68448b38","resolution":{"observed_at":"2026-08-15T14:39:14.477164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.479558Z","title":"AFLGuard: Byzantine-robust asynchronous federated learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.479558Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:eae13b9b72b14c387243b93a4f689c98fd8e3fc91b07e7e66ba9d1ee0f5babac","observation_id":"dfe02a52-ed10-4548-a311-cb65346e1921","resolution":{"observed_at":"2026-08-15T14:39:14.479558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03294","last_updated":"2025-06-20T17:11:24Z","snapshot_observed_at":"2026-08-13T22:09:41.395394Z","submitted_at":"2021-10-07T09:29:14Z","title":"EF21 with Bells & Whistles: Six Algorithmic Extensions of Modern Error Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03294","snapshot_observed_at":"2026-08-15T14:39:14.481867Z","title":"Ef21 with bells & whistles: Practical algorithmic extensions of modern error feedback.arXiv preprint arXiv:2110.03294, 2021.(Cited on pages 273, 274, and 350)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.481867Z"},"links":{"cited_paper":"/paper/2110.03294","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:010eddbdcecdffd729bcbebf298b926e584c27cfc08919aaf65cba4d1d7975a0","observation_id":"38bcc988-12ed-4bf9-948a-ccde50506231","resolution":{"observed_at":"2026-08-15T14:39:14.481867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.485070Z","title":"Efficient evaluation of scaled proxi- mal operators.Electronic Transactions on Numerical Analysis, 46:1–23, 03 2016.(Cited on page 44)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.485070Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:746cb71850a93eed2ce8426a6375bc612862c4a3f0efb95be573afb202820eb8","observation_id":"8b44f6ca-300b-47e4-b505-cd88d09797dd","resolution":{"observed_at":"2026-08-15T14:39:14.485070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.488048Z","title":"Stochastic first-and zeroth-order meth- ods for nonconvex stochastic programming.SIAM journal on optimization, 23(4):2341–2368, 2013.(Cited on page 406)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.488048Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:c1d930923f30c2b28bca338d8ddb14013ee5e3f007c71f897849bc9efe055f79","observation_id":"76beb639-582a-4c1c-acde-11e3152683ec","resolution":{"observed_at":"2026-08-15T14:39:14.488048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.491232Z","title":"Distributed new- ton can communicate less and resist Byzantine workers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.491232Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:d35adfe33a48dc3871654115782c118d150db3795b7b3ebee44a6b9cdc4d2962","observation_id":"f48c4445-310c-47e6-b104-f1c98fbbb567","resolution":{"observed_at":"2026-08-15T14:39:14.491232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.494311Z","title":"Communication-efficient and byzantine-robust dis- tributed learning with error feedback.IEEE Journal on Selected Areas in Information Theory, 2(3):942–953, 2021.(Cited on page 350)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.494311Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:28b51f1094081e76d50f06a648edbe1688e1bd1cdcab40831ede20a8701490f6","observation_id":"9850626d-ae01-4164-9414-dc731dab4b76","resolution":{"observed_at":"2026-08-15T14:39:14.494311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.497443Z","title":"Sharp bounds for federated averaging (local sgd) and continuous perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.497443Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:b0d5e1a06c9a6927edc2e720cadee87bef7cb57aafc921a46a79a5f67f612328","observation_id":"98b6c306-b56b-4b6f-8632-905cca1ad46b","resolution":{"observed_at":"2026-08-15T14:39:14.497443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.500729Z","title":"Television by pulse code modulation.Bell System Technical Journal, 30(1):33–49, 1951.(Cited on page 121)","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.500729Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:889143ba42ed4a568caaaabf54e576c6481e7e5ff2aaea69c82df19bc56e50ca","observation_id":"e13a42c0-db6a-4167-afac-bcc88db021a9","resolution":{"observed_at":"2026-08-15T14:39:14.500729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.503899Z","title":"Stochas- tic optimization with heavy-tailed noise via accelerated gradient clipping","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.503899Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:4b8db95ff07c370daba7a73ba86ab9a65e84cd2869b1ae4bd21654009abc17aa","observation_id":"d83c83e1-e647-42a4-8fad-44b4b43bfc5a","resolution":{"observed_at":"2026-08-15T14:39:14.503899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.506982Z","title":"A unified theory of SGD: Variance reduction, sampling, quantization and coordinate descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.506982Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:62e7cb9dbff59f265029dffff8acb67651d0a521fda13f44dd3e685cc6b25387","observation_id":"2a6ff18b-a2a0-4584-87ba-91c5066a0cd2","resolution":{"observed_at":"2026-08-15T14:39:14.506982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.510993Z","title":"Linearly converging error compensated SGD.Advances in Neural Information Processing Systems, 33:20889–20900, 2020c.(Cited on page 65)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.510993Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:62ae587d9118d3ca46e6c713fa830e2545d46127ea12ffc9779146653e9f5c2b","observation_id":"552b9fc9-f733-4477-9dba-302ba0fdce4d","resolution":{"observed_at":"2026-08-15T14:39:14.510993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.513850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.513850Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:94b0647509f323ee43a4107140872c1b74348355270b32eb715b0dd40d1658bf","observation_id":"45e6f806-b857-4c1c-b2c3-6c28e610468c","resolution":{"observed_at":"2026-08-15T14:39:14.513850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.516753Z","title":"Local SGD: Unified theory and new efficient methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.516753Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:5b8688cc94069c56f7c71f648b357e792730a12f1d6172fa61d18e45741e4c6a","observation_id":"1db21339-1087-43f7-ad6a-14e94aa48771","resolution":{"observed_at":"2026-08-15T14:39:14.516753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11257","last_updated":"2023-01-02T03:24:04Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:00:42Z","title":"Secure Distributed Training at Scale","version":4},"cited_work":{"arxiv_id":"2106.11257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11257","snapshot_observed_at":"2026-08-15T14:39:16.563590Z","title":"Secure Distributed Training at Scale","venue":"cs.LG","work_id":"eb747219-af3e-4109-9c4a-e4c5629a27f3","year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.519705Z"},"links":{"cited_paper":"/paper/2106.11257","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:78136c66842b9289506f871851bbe00d6043069f062e5cd58f435df5a66a4dd8","observation_id":"72a5e46f-f765-41f0-9190-1c0d248f167d","resolution":{"observed_at":"2026-08-15T14:39:16.567536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.522884Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.522884Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:f0437c34d115e265e01bc5b213e9f012a6f6a020e124fd2125bf18629e8dfe13","observation_id":"34e8dd34-6a15-4277-ad3b-3b8f1ee9fbc0","resolution":{"observed_at":"2026-08-15T14:39:14.522884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.526550Z","title":"Variance-reduced methods for machine learning.Proceedings of the IEEE, 108(11):1968–1983, 2020.(Cited on pages 30 and 349) 157","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.526550Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:bde72f06208c51b778cb2a71fe780589ba35f00a2a1d402ee1e8169ad9f77817","observation_id":"ba027ad6-bed5-4692-bd64-cdc06fbde200","resolution":{"observed_at":"2026-08-15T14:39:14.526550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.529674Z","title":"Gower, Peter Richt´ arik, and Francis Bach","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.529674Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:dcea9f98d97dd63243d4be38030702cf0f5aaccbe3185ad6f5511c9d99ef90a9","observation_id":"2efb3cc9-195a-4544-b9ab-80350fb40e51","resolution":{"observed_at":"2026-08-15T14:39:14.529674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.532630Z","title":"SGD: General analysis and improved rates","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.532630Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:26a7c5e376b3f96628680005270c7208d7cff68ebc2e21a11d75f870699464ad","observation_id":"5ea93c2e-9c6c-47f8-a3b7-50a62de60dcd","resolution":{"observed_at":"2026-08-15T14:39:14.532630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-15T14:39:14.535736Z","title":"Accurate, large minibatch sgd: training imagenet in 1 hour.arXiv preprint arXiv:1706.02677, 2017.(Cited on page 104)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.535736Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:cfe2f9faf07ea4525c3370f32138a93fa6adfabaf3cba973849bde73bb40912c","observation_id":"b83028b8-c34b-4cc2-aa5a-3b6205863c78","resolution":{"observed_at":"2026-08-15T14:39:14.535736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.539390Z","title":"Can 5th gen- eration local training methods support client sampling? yes! InInterna- tional Conference on Artificial Intelligence and Statistics, pages 1055–1092","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.539390Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:1e8fa7e091d017427c320d0797eb59444073d637caf77dc130374a1c316b79c6","observation_id":"2dd4ae5e-ef6d-4159-9789-60faa3b44952","resolution":{"observed_at":"2026-08-15T14:39:14.539390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03240","last_updated":"2023-06-05T20:50:36Z","snapshot_observed_at":"2026-08-13T11:23:55.677422Z","submitted_at":"2023-06-05T20:50:36Z","title":"Improving Accelerated Federated Learning with Compression and Importance Sampling","version":1},"cited_work":{"arxiv_id":"2306.03240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03240","snapshot_observed_at":"2026-08-15T14:39:16.542699Z","title":"Improving Accelerated Federated Learning with Compression and Importance Sampling","venue":"cs.LG","work_id":"3c3464ab-19a6-41d9-ae2e-c3866e16d5de","year":2023},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.542277Z"},"links":{"cited_paper":"/paper/2306.03240","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:03a5c9cc3514879bdd4e3f148c4def57039d619ba83e46afb03858aa0258689f","observation_id":"7a3bcec7-2b3e-4a9e-974a-551b5cd79bf5","resolution":{"observed_at":"2026-08-15T14:39:16.546131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.14425","last_updated":"2019-12-06T21:16:41Z","snapshot_observed_at":"2026-07-30T21:49:53.494348Z","submitted_at":"2019-10-31T12:52:55Z","title":"On the Convergence of Local Descent Methods in Federated Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.14425","snapshot_observed_at":"2026-08-15T14:39:14.545132Z","title":"On the convergence of local descent methods infederated learning.arXiv preprint arXiv:1910.14425, 2019.(Cited on pages 61 and 76)","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.545132Z"},"links":{"cited_paper":"/paper/1910.14425","citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:2fc811c50f79b35bd88cc6e425d9f0b98c58e04fe00c0aab59c12de3303187c6","observation_id":"e9b6cf79-beae-411a-8ff3-45d286249730","resolution":{"observed_at":"2026-08-15T14:39:14.545132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:14.547983Z","title":"Federated learning with compression: Unified analysis and sharp guarantees","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T14:39:14.547983Z"},"links":{"citing_paper":"/paper/2608.06563"},"observation_digest":"sha256:534d4c3a1a76203904d70df2da0b93f4b29b03576bdfad8d7eeb55851a965ea1","observation_id":"7a83a56e-40df-481a-9afb-2a9787a72a16","resolution":{"observed_at":"2026-08-15T14:39:14.547983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06563","last_updated":"2026-08-06T20:20:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T03:04:08.202720Z","submitted_at":"2026-08-06T20:20:52Z","title":"Theoretical Foundations of Communication-Efficient, Robust, and Practical Distributed and Federated Optimization"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 0 inbound Pith citation observations for arXiv:2608.06563."}