{"as_of":"2026-08-19T20:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:799a8779b770fe3dc0b37566513f45376ffc0122900a0d5eb7bd99c5db40dc14","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:16:05.092207Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.10889/citation-record","integrity":"/paper/2505.10889/integrity","json":"/paper/2505.10889/citation-record.json","paper":"/paper/2505.10889"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:04.870210Z","title":"A stochastic approximation method,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.870210Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:321870567d90eea49284f595d1c7adccc7c76e3406196c05213e0e22aaadb8d4","observation_id":"1b5f86fc-1484-450f-b64d-78e01a15e9ff","resolution":{"observed_at":"2026-08-15T21:16:04.870210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.811284Z","title":"Some methods of speeding up the convergence of iteration methods,","venue":null,"work_id":"52aa4875-27c2-49fc-805f-04d4042fde5f","year":1964},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.875811Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:0e7d08f06ad4a6cb130e9926e4c7e1f0d2b5d91a12b8bddc71b580a134bd91a5","observation_id":"7585abd5-81d3-41f0-8ca3-fcf92f29d43f","resolution":{"observed_at":"2026-08-15T21:16:05.816393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.793977Z","title":"Adaptive deep feature learning network with Nesterov momentum and its application to rotating machinery fault diagnosis,","venue":null,"work_id":"b1acd10a-0a94-4af7-8175-bde0f648ed9d","year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.881935Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:a8350805ea9824f2127087b8aad8855e3c556b523b00173c13ca270696b3e4dd","observation_id":"b807a7cb-5537-4f4d-a557-2a99fad654c7","resolution":{"observed_at":"2026-08-15T21:16:05.799392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.776762Z","title":"Combining ordered subsets and momentum for accelerated X-ray CT image reconstruction,","venue":null,"work_id":"c27ea325-be7c-4a70-9ef6-1fa0dc15a5ae","year":2014},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.887847Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:415bd7f91588833dd304ff4ffc148a53c62042c6d01fc449e8b81dd0c58a5872","observation_id":"9e5d4f43-4c8a-4c92-a6fc-8b05117e671b","resolution":{"observed_at":"2026-08-15T21:16:05.783110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.758801Z","title":"Speech recognition with deep recurrent neural networks,","venue":null,"work_id":"c7fbf983-f766-4f13-a30f-61fe28f5300f","year":2013},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.900026Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:ee368f5825c985fa12270a7315aa2759fbc2e41592c0a1467b6fb5f2b3d34635","observation_id":"d25caf16-974f-4e6e-9b89-42683cde325b","resolution":{"observed_at":"2026-08-15T21:16:05.764791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.739453Z","title":"SGD and Hogwild! convergence without the bounded gradients assumption,","venue":null,"work_id":"17974b61-4c12-47a6-82a2-cc47bd0232cf","year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.909718Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:73ffcf827155f5a54495bc748a089e5843cedf8664090e648511e76619656066","observation_id":"2311f3d8-5143-4f18-ac09-c0031f7e3d24","resolution":{"observed_at":"2026-08-15T21:16:05.745177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:04.917004Z","title":"Reducing the dimensionality of data with neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.917004Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:3287c96529ea7c872c4d077e643a0b6949d9edc591d8b1c4df002fac1655b077","observation_id":"61dccd6c-5dc3-4985-a3e2-482351608cf1","resolution":{"observed_at":"2026-08-15T21:16:04.917004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.706579Z","title":"Distributed training strategies for the structured perceptron,","venue":null,"work_id":"e8a1182f-b665-4041-afd1-50dd8431e090","year":2010},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.923055Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:d48d7ce8f3af5e6d3440bc455466ad215bbb4564468da016cc6ed87572e2d90f","observation_id":"28293377-7842-44e8-bbee-1a415bf18e64","resolution":{"observed_at":"2026-08-15T21:16:05.712772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.689411Z","title":"Deep learning with elastic averaging sgd,","venue":null,"work_id":"a967da08-94f2-42ef-8e7c-3ec8ed4a3372","year":2015},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.928793Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:ed4b310530025debee5b2ef9620f2c95574c1304d990bc3dd99a2fbf9debbcb0","observation_id":"09b2f917-3779-4625-9eea-956a35f780f4","resolution":{"observed_at":"2026-08-15T21:16:05.694937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.671344Z","title":"Network topology and communication-computation tradeoffs in decentralized optimization,","venue":null,"work_id":"b42c3f4f-40f7-4fc5-8be4-a59d98dc6dcd","year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.934245Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:4ae866cb03c083d1b1d8ae8f2d7037884cbe0e8d59e02eb23ebaf76f7d5862d0","observation_id":"be118f36-a1fd-4cd2-adfc-7a1d16366ecf","resolution":{"observed_at":"2026-08-15T21:16:05.677857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09767","last_updated":"2019-05-03T12:58:04Z","snapshot_observed_at":"2026-08-14T19:11:29.708396Z","submitted_at":"2018-05-24T16:38:51Z","title":"Local SGD Converges Fast and Communicates Little","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09767","snapshot_observed_at":"2026-08-15T21:16:04.939109Z","title":"Local sgd converges fast and communicates little,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.939109Z"},"links":{"cited_paper":"/paper/1805.09767","citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:d37a35f09770eb95292617f3f21b6a7aeb834ac062034773fef29a4bdfdfdbea","observation_id":"8ba79a71-f9ed-4ec2-b28a-5e96becd7255","resolution":{"observed_at":"2026-08-15T21:16:04.939109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.652607Z","title":"Parallel restarted sgd with faster convergence and less communication: Demystifying why model averaging works for deep learning,","venue":null,"work_id":"8bc23fc1-8161-46ef-90be-0acc82978135","year":2019},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.945190Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:cc801b4a1f5a511cd7415bcb16f803c3fe4c07df185606c1696104e47b3e9305","observation_id":"3c49b6d1-4c9e-4dce-994f-4bbc64568414","resolution":{"observed_at":"2026-08-15T21:16:05.658384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.631956Z","title":"A linear speedup analysis of distributed deep learning with sparse and quantized communication,","venue":null,"work_id":"2e92e40f-82cf-44d3-9065-9924c4fae9e5","year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.950550Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:a97b4c913aac1e7f8b3002e11a58445042a291cde253099909bd5bb955fab534","observation_id":"e04901f1-2fae-44e9-86a5-c19c7cef8610","resolution":{"observed_at":"2026-08-15T21:16:05.638473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:04.959122Z","title":"Can decentralized algorithms outperform centralized algorithms? a case study for decentralized parallel stochastic gradient descent,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.959122Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:b3beede8eeaa3e694ecc614338c3c34bd2be2e6b6893dab776895186f217a910","observation_id":"d7cc35b9-7ac1-4333-b872-59d8a830cf17","resolution":{"observed_at":"2026-08-15T21:16:04.959122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.602664Z","title":"Collaborative deep learning in fixed topology networks,","venue":null,"work_id":"213fdf66-0fef-49ff-87b1-1dd2a6bba36b","year":2017},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.965081Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:0cf2be148ac4d6950ed8196c3d279443d58f763eba8617ce8c58c1302b45cad8","observation_id":"bd5fc640-7e5a-4828-8cea-377fc323f43a","resolution":{"observed_at":"2026-08-15T21:16:05.609126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:04.970086Z","title":"On nonconvex decentralized gradient descent,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.970086Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:4537a937029d2c737b8924478db30e52fdc94d20de8bd00081e74bbc04fba06b","observation_id":"54d6075a-44b8-4aa7-89e9-dae226ecf6aa","resolution":{"observed_at":"2026-08-15T21:16:04.970086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.573156Z","title":"Cooperative sgd: A unified framework for the design and analysis of local-update sgd algorithms,","venue":null,"work_id":"9fef02d5-a26b-4a3b-916b-60100e0698ae","year":2021},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.974941Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:8421ad57768cd6e98a800b6d93d46ec00bd08ffb7a0aea31600b3faf81e78431","observation_id":"21478628-8e38-4c4f-bc5a-787d95886490","resolution":{"observed_at":"2026-08-15T21:16:05.578632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.554595Z","title":"Imagenet classification with deep convolutional neural networks,","venue":null,"work_id":"f62f77c2-9050-4382-b889-0ca36c5daff1","year":2012},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.981179Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:5580591262b479811804785f7d2f8c12a14797105dd1f45a9c2ae97c50e24c29","observation_id":"5968c1dd-000c-4260-85ef-567626f646cd","resolution":{"observed_at":"2026-08-15T21:16:05.560596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10396","last_updated":"2018-08-30T17:00:03Z","snapshot_observed_at":"2026-08-14T18:35:00.100434Z","submitted_at":"2018-08-30T17:00:03Z","title":"A Unified Analysis of Stochastic Momentum Methods for Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10396","snapshot_observed_at":"2026-08-15T21:16:04.987777Z","title":"A unified analysis of stochastic momentum methods for deep learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.987777Z"},"links":{"cited_paper":"/paper/1808.10396","citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:c1e65ee0d78d54212161d37d551d1306cd9a1890d0a491ea741eaf8ee91cfcd3","observation_id":"063a5a98-a5ae-47e7-bb83-de7c48a3e4b8","resolution":{"observed_at":"2026-08-15T21:16:04.987777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.537040Z","title":"On the importance of initialization and momentum in deep learning,","venue":null,"work_id":"d7138b86-4e5d-4bc8-989b-dadc8db944e9","year":2013},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:04.995072Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:9d13a1f16dae5490c0db11e6e8cacdb9a1f160eed205a238d46ac21809a82716","observation_id":"22d8a116-b5a8-472d-827d-3cd5064a03e6","resolution":{"observed_at":"2026-08-15T21:16:05.542612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.519394Z","title":"On the linear speedup analysis of communication efficient momentum sgd for distributed non- convex optimization,","venue":null,"work_id":"ece12c4a-e576-4804-8378-0fcd7487ed9d","year":2019},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.001300Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:e5e397fdbf6d89c7a79de84aaffc0cbd51b4fd484818dd3f285dc3e6ea106405","observation_id":"d3c4ab34-6398-4381-a1d0-c753a7476d50","resolution":{"observed_at":"2026-08-15T21:16:05.524880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.499195Z","title":"On consensus- optimality trade-offs in collaborative deep learning,","venue":null,"work_id":"89a9df8d-a949-42b5-b9a1-a969181bfcf9","year":2021},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.006388Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:0511b8f6984c3581aad81715832c35c59ecfdd515cef5ad94c904bc077bb8c5b","observation_id":"615cb8d7-1509-4876-838e-b19ce8728ba0","resolution":{"observed_at":"2026-08-15T21:16:05.507346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.476403Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":"5ab31f80-bb9d-4197-b429-dd533368d2b1","year":2018},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.011429Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:7003c72791a9624c419a0a7f3849635e3b0939a647aec387e0a9ccb96c13323b","observation_id":"3be9fce3-33cf-4350-af62-f99cc5b9cbdc","resolution":{"observed_at":"2026-08-15T21:16:05.484749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.456717Z","title":"Can decentralized algorithms outperform centralized algorithms? a case study for decentralized parallel stochastic gradient descent,","venue":null,"work_id":"81fc9b29-8439-49fb-bb73-fc18163a3444","year":2017},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.016562Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:c8de423d80c96be16b32da6fde092d078db7be3d2b6d595a9cae2092b35d8834","observation_id":"351bc966-cd6c-4988-b96b-29baf7d61ca0","resolution":{"observed_at":"2026-08-15T21:16:05.463015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.439436Z","title":"Decentlam: Decentralized momentum sgd for large-batch deep training,","venue":null,"work_id":"4be460ce-e8e7-4e95-8f13-6f5cdb9aa759","year":2021},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.022135Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:3d47e8e206c17b2be8e87164cfc355c5c85faa7647e72f918f48073bf01fefb1","observation_id":"2af36f5a-24eb-46ea-b0fa-ca8a190c034b","resolution":{"observed_at":"2026-08-15T21:16:05.445325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.417198Z","title":"2020SQuARM: Communication-efficient momentum SGD for decentralized optimization,","venue":null,"work_id":"3088957e-571a-4054-aab6-6705346e9ef8","year":2021},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.026972Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:9969f2e4aa40cc5b8278de56bc05ab06db22d49f384096c5afee26c755f5cf33","observation_id":"800f32fa-3c7f-41c4-a694-f859fd295700","resolution":{"observed_at":"2026-08-15T21:16:05.422343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.10435","last_updated":"2020-08-24T13:38:22Z","snapshot_observed_at":"2026-08-18T11:44:50.907882Z","submitted_at":"2020-08-24T13:38:22Z","title":"Periodic Stochastic Gradient Descent with Momentum for Decentralized Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.10435","snapshot_observed_at":"2026-08-15T21:16:05.031704Z","title":"Periodic stochastic gradient descent with momentum for decentralized training,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.031704Z"},"links":{"cited_paper":"/paper/2008.10435","citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:4a457724b5e93c33b2348b5e2a54c01a5425375578c220d7f3065722bd577c89","observation_id":"03643d56-567b-42d2-bde3-7f2e2674825f","resolution":{"observed_at":"2026-08-15T21:16:05.031704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.397326Z","title":"Decentralized deep learning using momentum-accelerated consensus,","venue":null,"work_id":"c740a190-ac06-4a5b-8c1a-2777a959051a","year":2021},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.037280Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:6981a4546a49391fa5019d0d9e21fa1e4478c358d60ee09939835ca0c32735c7","observation_id":"e6b9600d-3953-418e-a5ae-5b625c772bdc","resolution":{"observed_at":"2026-08-15T21:16:05.403893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.378480Z","title":"Parallel restarted sgd with faster convergence and less communication: Demystifying why model averaging works for deep learning,","venue":null,"work_id":"8fa7e817-06f8-4c8a-9133-d31856ac95c1","year":2019},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.042769Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:bc54fa5e393bc895ede8ffc929ec5ab862585c3ccbd0930203609c29294ae5e1","observation_id":"2039e531-6c49-4595-b67b-0fedeebd52be","resolution":{"observed_at":"2026-08-15T21:16:05.384740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.359074Z","title":"On the convergence of mSGD and AdaGrad for stochastic optimization,","venue":null,"work_id":"ef4bf050-0a34-4feb-a31a-7e1cdcc58012","year":2022},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.047649Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:8b1dd473930d36bfd95d93faf5541d421f305c4f60eae65886cb0313a6db3acb","observation_id":"58a2e080-9d1c-455e-84a1-8ad434aad158","resolution":{"observed_at":"2026-08-15T21:16:05.365253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00489","last_updated":"2018-02-24T00:16:12Z","snapshot_observed_at":"2026-08-14T20:17:53.425800Z","submitted_at":"2017-11-01T18:04:31Z","title":"Don't Decay the Learning Rate, Increase the Batch Size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00489","snapshot_observed_at":"2026-08-15T21:16:05.053234Z","title":"Don’t decay the learning rate, increase the batch size,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.053234Z"},"links":{"cited_paper":"/paper/1711.00489","citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:7f46ff827cc2e9ec6af34a82ee3f2dd246f344c922b8512672371c497f03cf1e","observation_id":"4cbe6bf7-67b3-45b1-bdbf-c4747bbdeefc","resolution":{"observed_at":"2026-08-15T21:16:05.053234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.341248Z","title":"Bayesian learning via stochastic gradient langevin dynamics,","venue":null,"work_id":"2146d23f-1122-4c35-9c25-e0e9d7aba2b4","year":2011},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.059295Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:4535ac6fe43bcccfd107e7da67b9fafa960c3bf606007c838786317fb744de31","observation_id":"696e5d03-2482-4598-9f3f-27ea1dba391d","resolution":{"observed_at":"2026-08-15T21:16:05.346931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.322101Z","title":"Convergence of proximal-gradient stochastic variational inference under non-decreasing step-size sequence,","venue":null,"work_id":"32227f06-dc87-4a5f-921c-71b230700bac","year":2015},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.065059Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:de59fee11282591d19b9453e7f3e3014793b69bfaa02812169d404c4386d46b3","observation_id":"cfc784d5-d69d-4e7c-9cc0-f008fbdc5273","resolution":{"observed_at":"2026-08-15T21:16:05.328386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.302866Z","title":"Understanding the role of momentum in stochastic gradient methods,","venue":null,"work_id":"2560b91a-f623-4cd9-9308-fd839718d433","year":2019},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.070661Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:d61a00f4b19c7fe625be522864a6d84a762f64258d6b88a1464637ad87d1727a","observation_id":"d656d89c-cd16-4138-b152-92cb33613746","resolution":{"observed_at":"2026-08-15T21:16:05.308628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.282202Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"45da58b3-8842-47a1-804c-96c5c4a0493f","year":2016},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.075459Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:ea46d3f5f7c2744fa3f941aa79f88fb7e6309d766b99234f087fdef8a2a99e78","observation_id":"a5415d8d-8810-476f-b99f-1868005ba493","resolution":{"observed_at":"2026-08-15T21:16:05.288603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.260130Z","title":"Nesterov,Introductory Lectures on Convex Optimization: A Basic Course","venue":null,"work_id":"03031066-da93-4ac2-9868-8ba02a3f39eb","year":2004},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.081368Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:b510c4ea82552b8f74c33f038cb32090a84776724b7827dfe1de17ee206852bb","observation_id":"0214823a-791f-4ca3-93aa-1578f2ad0091","resolution":{"observed_at":"2026-08-15T21:16:05.266884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.239723Z","title":"Revisit last- iterate convergence of msgd under milder requirement on step size","venue":null,"work_id":"1c9ab290-8d91-4ff0-aba9-5c9472e918e2","year":2022},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.086621Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:3259e3aa94648500a8eb9d93290abd87fc0de6810137473cd1954652a898f988","observation_id":"e8d7a3ba-bd4b-439c-8769-b5e6561f3fe8","resolution":{"observed_at":"2026-08-15T21:16:05.245733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:05.216056Z","title":"On almost sure convergence for sums of stochastic sequence,","venue":null,"work_id":"0d4dddd7-9849-46bb-b1a7-806de1bc2b5f","year":2019},"citing_paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:05.092207Z"},"links":{"citing_paper":"/paper/2505.10889"},"observation_digest":"sha256:c2955a2f3080704649fe02306f424fae625981088745a950a5ed3959a4314f0e","observation_id":"4d126e17-d5ef-42e8-9b5e-e2e73f0ad451","resolution":{"observed_at":"2026-08-15T21:16:05.225176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10889","last_updated":"2025-05-16T05:52:12Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-18T01:44:39.833962Z","submitted_at":"2025-05-16T05:52:12Z","title":"Convergence Analysis of the Last Iterate in Distributed Stochastic Gradient Descent with Momentum"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2505.10889."}