{"as_of":"2026-08-15T19:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b1d4f19651bfb6409fc1835c7ce578bf4d9176757948d7c0a7dc3fd1b92b65a","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:50:42.853083Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:28.702340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-07T12:45:28.702340Z","title":"Communication efficient LLM pre-training with sparseloco","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-15T09:11:22.528034Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.702340Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2505.23725"},"observation_digest":"sha256:223748e1d847b4ab4798afb28205efd82737d6845d462cf55511dd0e48099fcc","observation_id":"c154d6ed-ccdb-41eb-b8d5-14eba14dc59e","resolution":{"observed_at":"2026-08-07T12:45:28.702340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2602.03839","last_updated":"2026-05-19T16:03:06Z","snapshot_observed_at":"2026-07-06T22:44:23.981940Z","submitted_at":"2026-02-03T18:56:48Z","title":"Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T13:37:20.114152Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2602.03839"},"observation_digest":"sha256:754081432bd2950e39b37a219e31db73880dbf777c3420bcd9974626e23162b6","observation_id":"126fe051-41cf-4dbe-ad5b-43d896bd82b0","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-03T04:44:55.982385Z","title":"Com- munication efficient LLM pre-training with sparseloco","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04396","last_updated":"2026-06-17T18:22:54Z","snapshot_observed_at":"2026-08-12T22:57:18.157130Z","submitted_at":"2026-02-04T10:25:24Z","title":"LoRDO: Distributed Low-Rank Optimization with Infrequent Communication","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:44:55.982385Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2602.04396"},"observation_digest":"sha256:77f723903eb03bfc2a39047c5fac14c770396fe1e21b770c4a61b05e0d640f06","observation_id":"a68ffe5a-ef00-452d-a16c-cbcc61f46106","resolution":{"observed_at":"2026-08-03T04:44:55.982385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2604.11947","last_updated":"2026-04-13T18:40:45Z","snapshot_observed_at":"2026-08-15T09:32:18.843096Z","submitted_at":"2026-04-13T18:40:45Z","title":"ResBM: Residual Bottleneck Models for Low-Bandwidth Pipeline Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:15.760164Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2604.11947"},"observation_digest":"sha256:5ae721781cd9512171de6708393336fd7e0cd9d71e469a923bf368e871c9e6f3","observation_id":"c0dcd1dc-464b-4c46-84c0-ed2d084ad204","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-15T15:49:31.621402Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:320c5a087711450f524fe191a1aade4f5b1a2dc0aeb05d521f16732e95d28886","observation_id":"3646a5f2-e9f7-45ea-9aa6-f819aa2acaf6","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-15T15:49:31.621402Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:766f75460311573d7e9d9e26c65adc143f80d4466a4d0e40f2952459eb49a44d","observation_id":"9fb95a3d-52ce-4a82-ad20-b73f8a39e7da","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2606.05484","last_updated":"2026-06-03T22:10:16Z","snapshot_observed_at":"2026-08-08T18:26:57.970156Z","submitted_at":"2026-06-03T22:10:16Z","title":"Learned Subspace Compression for Communication-Efficient Pipeline Parallelism","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:58.301482Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2606.05484"},"observation_digest":"sha256:2f8a0995d5d2cb9d5df4d11ef83e04fb6bd1b19e4f12a0728784f63083e1fbba","observation_id":"6cc8a123-c7b5-4134-83e1-63c5c4fb1c83","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2606.11081","last_updated":"2026-06-09T16:40:54Z","snapshot_observed_at":"2026-08-03T08:40:34.396170Z","submitted_at":"2026-06-09T16:40:54Z","title":"Unifying Local Communications and Local Updates for LLM Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T14:07:42.062805Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2606.11081"},"observation_digest":"sha256:582286d8ca8f7e9c9bb5e3c94af9e69e3b933bf955a894c4cf86444738c44868","observation_id":"bc42eb0a-9ce7-46ac-9282-99f3de76e69b","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2606.19025","last_updated":"2026-06-20T12:18:17Z","snapshot_observed_at":"2026-08-15T15:49:45.612865Z","submitted_at":"2026-06-17T12:50:07Z","title":"FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs","version":2},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:15.709652Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2606.19025"},"observation_digest":"sha256:ca5b494f7697c79d56205865dc8a7fc1482e1730a155bae7e844a921b6bb2975","observation_id":"abe9d0ca-ee98-467a-870c-9ed1dcc00a57","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.15706/citation-record","integrity":"/paper/2508.15706/integrity","json":"/paper/2508.15706/citation-record.json","paper":"/paper/2508.15706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.313989Z","title":"16 Preprint Table 12: Final validation loss for the 178M model while varying the number of workers (R∈ {8,16,32}) and the communication interval (H∈ {15,50,100}).Bestis bold","venue":null,"work_id":"697476ba-27c3-412e-ae7f-d927372e14fe","year":2048},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.853083Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:8c88af1c1d7a1cd6c8bd9517ac9b71d209a15a85a76d723d2e57e8032072c152","observation_id":"6221515e-e182-4be1-823f-8309dee29e8b","resolution":{"observed_at":"2026-08-05T17:50:43.317668Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T17:50:42.630685Z","title":"Train- ing compute-optimal large language models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.630685Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:9e28855a4c1c8e1c8732fbcd0ac2311af00f5324832861d8f4ded99bbd1181ca","observation_id":"02098e63-497e-48e5-b296-5fcc499f8ff9","resolution":{"observed_at":"2026-08-05T17:50:42.630685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01152","last_updated":"2024-12-02T05:52:32Z","snapshot_observed_at":"2026-08-14T20:08:24.706727Z","submitted_at":"2024-12-02T05:52:32Z","title":"INTELLECT-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01152","snapshot_observed_at":"2026-08-05T17:50:42.768010Z","title":"Charles- ´Etienne Joseph, Benjamin Th ´erien, Abhinav Moudgil, Boris Knyazev, and Eugene Belilovsky","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.768010Z"},"links":{"cited_paper":"/paper/2412.01152","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:483867b806fd50d65df928f6fdaf396964e692a51e0dfbf8c11fd8a87a5199ea","observation_id":"63df926d-8e53-4189-88e7-22d9e4ffa8e5","resolution":{"observed_at":"2026-08-05T17:50:42.768010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-13T11:54:17.209519Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-05T17:50:42.783058Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.783058Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:b2c4f0311e8e8d2abb7c3e9c79f3a55b75156e20b3b77ab63b66ca3540e4c5c5","observation_id":"bf1d3653-3e5a-48ba-a4f7-dd2cbb1f5aa0","resolution":{"observed_at":"2026-08-05T17:50:42.783058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.394212Z","title":null,"venue":null,"work_id":"ad729f8c-7f9a-4b15-a502-e93ee574a4bd","year":2024},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.786073Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:156175ab690379283f0ab77de93801e3fbf92bebf995e1926038cbadc3453320","observation_id":"a45babaf-8826-4cf5-87ea-5c08e4a1d170","resolution":{"observed_at":"2026-08-05T17:50:43.397038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.384592Z","title":"Shigang Li and Torsten Hoefler","venue":null,"work_id":"bb1e8f0f-9974-40f7-97d5-ff46d554f1dd","year":2024},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.789216Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:07bc700bc85be497f34e168226be5fb88f4693e0ceae8f24eceb978bb339fecb","observation_id":"77bef573-8aeb-4a55-b5b4-a2b3846e9218","resolution":{"observed_at":"2026-08-05T17:50:43.387707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.375587Z","title":"Federated optimization in heterogeneous networks","venue":null,"work_id":"116c9105-106c-47d1-bcba-6c0bc4ada5b4","year":2020},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.793019Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:3308497b55554a8f0762688a5d3d71da6ae79755693694b0c304340e2f80efa1","observation_id":"1e9f20c1-531a-4430-ae6f-0a1001da84c6","resolution":{"observed_at":"2026-08-05T17:50:43.378489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21684","last_updated":"2025-05-27T19:11:22Z","snapshot_observed_at":"2026-08-15T17:37:59.589521Z","submitted_at":"2025-05-27T19:11:22Z","title":"Incentivizing Permissionless Distributed Learning of LLMs","version":1},"cited_work":{"arxiv_id":"2505.21684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21684","snapshot_observed_at":"2026-08-05T17:50:43.158551Z","title":"Incentivizing Permissionless Distributed Learning of LLMs","venue":"cs.LG","work_id":"fdac7bc1-4bea-440b-9690-31584c849dcd","year":2025},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.795875Z"},"links":{"cited_paper":"/paper/2505.21684","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:5f0386e4aa0947d24e01d8eab59a2a8099875eb8306617bfff7bba474be034b9","observation_id":"0c0f2604-2fcd-4c56-98ed-9444dc80d49b","resolution":{"observed_at":"2026-08-05T17:50:43.162053Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07217","last_updated":"2020-02-17T11:42:10Z","snapshot_observed_at":"2026-08-14T18:38:32.170609Z","submitted_at":"2018-08-22T04:50:55Z","title":"Don't Use Large Mini-Batches, Use Local SGD","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07217","snapshot_observed_at":"2026-08-05T17:50:42.798739Z","title":"Stich, and Martin Jaggi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.798739Z"},"links":{"cited_paper":"/paper/1808.07217","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:28a33dbb79cc7f2d25632a853d11cf1a201a9aed944c5b01793beda6ee30a03f","observation_id":"b85900f8-f8d3-49e3-8353-904a2293331a","resolution":{"observed_at":"2026-08-05T17:50:42.798739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08133","last_updated":"2021-10-15T15:00:42Z","snapshot_observed_at":"2026-08-13T03:45:03.466690Z","submitted_at":"2021-10-15T15:00:42Z","title":"Trade-offs of Local SGD at Scale: An Empirical Study","version":1},"cited_work":{"arxiv_id":"2110.08133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.08133","snapshot_observed_at":"2026-08-05T17:50:43.117651Z","title":"Trade-offs of Local SGD at Scale: An Empirical Study","venue":"cs.LG","work_id":"1ec9c1af-9ef5-472f-8622-87f6fcfdad69","year":2021},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.805050Z"},"links":{"cited_paper":"/paper/2110.08133","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:7b11f883e9df4960fbd835a147d10c82a3d62840e01ab64555561969ccf33394","observation_id":"fd604448-d23b-4e34-a966-a2ad89c2f040","resolution":{"observed_at":"2026-08-05T17:50:43.123584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00295","last_updated":"2021-09-08T23:37:17Z","snapshot_observed_at":"2026-08-13T06:06:10.844945Z","submitted_at":"2020-02-29T16:37:29Z","title":"Adaptive Federated Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.00295","snapshot_observed_at":"2026-08-05T17:50:42.811192Z","title":"Adaptive federated optimization.arXiv preprint arXiv:2003.00295,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.811192Z"},"links":{"cited_paper":"/paper/2003.00295","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:6f207faa22c0ec63c1110a6b944172bf8476d37db7bc4085cfd457e1165525c9","observation_id":"76434ade-3f92-47d1-995a-cf1f69e543e0","resolution":{"observed_at":"2026-08-05T17:50:42.811192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.365951Z","title":"Fedpaq: A communication-efficient federated learning method with periodic averaging and quan- tization","venue":null,"work_id":"66a19e38-079f-42b5-b894-7a5931fc51ba","year":2020},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.814455Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:e1064f7dcad6b4be00fccef81ca9546b43a9ff7a73dee043be8b1c7774afc63a","observation_id":"4a93db86-469d-456f-8eb1-fbe2d0c37ee1","resolution":{"observed_at":"2026-08-05T17:50:43.369319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.354980Z","title":"Daniel Rothchild, Ashwinee Panda, Enayat Ullah, Nikita Ivkin, Ion Stoica, Vladimir Braverman, Joseph Gonzalez, and Raman Arora","venue":null,"work_id":"fe016071-4ff8-4e4a-80ef-1e4e53a79d29","year":2020},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.817061Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:abd01b88923cba119cb715b4a6426a6566df0a96420ccf96dcabeed5c932463a","observation_id":"f54a0ab4-e55b-46fc-a858-74364dacdff9","resolution":{"observed_at":"2026-08-05T17:50:43.358390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.345422Z","title":"Frank Seide, Hao Fu, Jasha Droppo, Gang Li, and Dong Yu","venue":null,"work_id":"1bf1d304-3129-458d-81c8-eb80b3438879","year":2014},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.819836Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:6bdf1af4f80bca442448297a3f3e7c8011f6be2f504bb6731fef9d7363df9b0f","observation_id":"e9ceadcd-49c7-4772-b107-db8fe1eada13","resolution":{"observed_at":"2026-08-05T17:50:43.348698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09767","last_updated":"2019-05-03T12:58:04Z","snapshot_observed_at":"2026-08-14T19:11:29.708396Z","submitted_at":"2018-05-24T16:38:51Z","title":"Local SGD Converges Fast and Communicates Little","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09767","snapshot_observed_at":"2026-08-05T17:50:42.825545Z","title":"Local sgd converges fast and communicates little.arXiv preprint arXiv:1805.09767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.825545Z"},"links":{"cited_paper":"/paper/1805.09767","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:391874dc041b929d46c4772d473bdf27c84b9d27cd20f3f02a71ee9ae00489d5","observation_id":"cfda8956-9216-4fbf-abad-c3a3e96ce514","resolution":{"observed_at":"2026-08-05T17:50:42.825545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05350","last_updated":"2021-06-16T15:44:47Z","snapshot_observed_at":"2026-08-14T18:30:33.361056Z","submitted_at":"2019-09-11T20:54:49Z","title":"The Error-Feedback Framework: Better Rates for SGD with Delayed Gradients and Compressed Communication","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05350","snapshot_observed_at":"2026-08-05T17:50:42.832022Z","title":"Benjamin Th´erien, Xiaolong Huang, Irina Rish, and Eugene Belilovsky","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.832022Z"},"links":{"cited_paper":"/paper/1909.05350","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:dc6ac8a5177bcae3d0fef1d9f0134c4ee5f974880cbb010a30b3f4b6f421b0e7","observation_id":"c7b2f858-94bd-43c9-aaa2-4f663a26e2d7","resolution":{"observed_at":"2026-08-05T17:50:42.832022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-15T09:11:22.528034Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23725","snapshot_observed_at":"2026-08-05T17:50:42.834629Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Niko- lay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.834629Z"},"links":{"cited_paper":"/paper/2505.23725","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:7230d7161c31b96f24ce9b66851a5b8906b941c4aef309b39d865f68a1d79978","observation_id":"cfa86fd4-b77c-4429-a9d6-4c88b674ac0b","resolution":{"observed_at":"2026-08-05T17:50:42.834629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.333972Z","title":"Powersgd: Practical low-rank gra- dient compression for distributed optimization","venue":null,"work_id":"5ccaae24-2979-4a08-8130-3b307bb66842","year":2019},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.837941Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:efb91e9e1b033ddce6e361a9c60cca5efef4693a4746e6124845585828ebe333","observation_id":"bc7ce4e6-e092-4508-84f9-ee6e9fb245d7","resolution":{"observed_at":"2026-08-05T17:50:43.338673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00643","last_updated":"2020-02-19T20:00:02Z","snapshot_observed_at":"2026-08-11T15:09:30.727773Z","submitted_at":"2019-10-01T20:06:48Z","title":"SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00643","snapshot_observed_at":"2026-08-05T17:50:42.840735Z","title":"Jianyu Wang, Vinayak Tantia, Nicolas Ballas, and Michael G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.840735Z"},"links":{"cited_paper":"/paper/1910.00643","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:e5f232e5ccee090b025211a0aa78c7fcbcd3cc16728ecd569411e670bf25bb1e","observation_id":"319545ff-8ff6-45a6-bd7d-c89389b22308","resolution":{"observed_at":"2026-08-05T17:50:42.840735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:42.843800Z","title":"12 Preprint Prateek Yadav, Derek Tam, Leshem Choshen, Colin Raffel, and Mohit Bansal","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.843800Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:3d06d0ea9ce1428f8f36df536c8cb5bc92abf45b5cf62a6bfb5ca3e58f5b63eb","observation_id":"cb840401-95b0-47c9-8ce9-921e70a0c235","resolution":{"observed_at":"2026-08-05T17:50:42.843800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-08-13T15:23:54.677158Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-05T17:50:42.846515Z","title":"Hanzhen Zhao, Xingyu Xie, Cong Fang, and Zhouchen Lin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.846515Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:5a0946e74cd955ab9c6d6cc8b05fe38727c8832b8c2314a81755e9cd3070a8e9","observation_id":"0b5e8ceb-46a3-4688-9858-41b8c4b4d0c1","resolution":{"observed_at":"2026-08-05T17:50:42.846515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.324177Z","title":null,"venue":null,"work_id":"e600211c-7f07-4601-9017-0a1444b3f87f","year":2024},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.850040Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:0e2fff290da1d5538e37911c253cdef30188bc93ab108f010eaf85ea457ff03c","observation_id":"22f7550f-3658-46d9-98b9-5618ee0a8859","resolution":{"observed_at":"2026-08-05T17:50:43.327078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08772","last_updated":"2019-11-20T08:50:59Z","snapshot_observed_at":"2026-08-14T07:05:44.600020Z","submitted_at":"2019-11-20T08:50:59Z","title":"Understanding Top-k Sparsification in Distributed Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08772","snapshot_observed_at":"2026-08-05T17:50:42.822540Z","title":"2014-274","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.822540Z"},"links":{"cited_paper":"/paper/1911.08772","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:727a09a7705f59978617141be0e0133be3122392d8e389b32bda76cb1b17d3d8","observation_id":"b4982b35-9e66-4f74-905e-e11c073a41fe","resolution":{"observed_at":"2026-08-05T17:50:42.822540Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.402894Z","title":"Ilyas Fatkhullin, Alexander Tyurin, and Peter Richt´arik","venue":null,"work_id":"64803f6b-8ccc-4041-a2d3-884412998d87","year":2023},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.460974Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:37b95a57fb1620a37d05f3e4cf73e034e963c4e0be155430e4368583929dc1fa","observation_id":"9882bc39-c807-4627-80db-8146ef538214","resolution":{"observed_at":"2026-08-05T17:50:43.405846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02664","last_updated":"2022-05-19T18:18:32Z","snapshot_observed_at":"2026-08-13T17:02:45.654734Z","submitted_at":"2022-01-07T20:17:33Z","title":"Optimizing the Communication-Accuracy Trade-off in Federated Learning with Rate-Distortion Theory","version":3},"cited_work":{"arxiv_id":"2201.02664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.02664","snapshot_observed_at":"2026-08-05T17:50:43.134471Z","title":"Optimizing the Communication-Accuracy Trade-off in Federated Learning with Rate-Distortion Theory","venue":"cs.LG","work_id":"08cddef4-920b-44ea-a411-5e82f0f27cf0","year":2022},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.801755Z"},"links":{"cited_paper":"/paper/2201.02664","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:35e056459b7d4b40643963d5adfca2f1b87300efa6eac5e19185a20d974693d6","observation_id":"705b1671-64c1-4608-8a81-a1538f6a8306","resolution":{"observed_at":"2026-08-05T17:50:43.138006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09847","last_updated":"2019-05-29T12:57:30Z","snapshot_observed_at":"2026-08-14T22:19:14.195392Z","submitted_at":"2019-01-28T17:39:54Z","title":"Error Feedback Fixes SignSGD and other Gradient Compression Schemes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09847","snapshot_observed_at":"2026-08-05T17:50:42.775569Z","title":"org/abs/1901.09847","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.775569Z"},"links":{"cited_paper":"/paper/1901.09847","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:2adcf3c415c96f30f547ccc0c97591107d9fc57882b81e8dbc75c5c5d20b091c","observation_id":"86d2e3ab-221c-43e8-9605-21c57eb89b87","resolution":{"observed_at":"2026-08-05T17:50:42.775569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02527","last_updated":"2016-10-08T13:25:15Z","snapshot_observed_at":"2026-08-14T21:36:07.062248Z","submitted_at":"2016-10-08T13:25:15Z","title":"Federated Optimization: Distributed Machine Learning for On-Device Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02527","snapshot_observed_at":"2026-08-05T17:50:42.779456Z","title":"Federated optimization: Distributed machine learning for on-device intelligence.arXiv preprint arXiv:1610.02527,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.779456Z"},"links":{"cited_paper":"/paper/1610.02527","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:58be2ceecc3ba33584f43c60bd182f1e337110b6e5a34d02940a4fe8be19cf7a","observation_id":"ee5d3247-a933-498e-a5b7-1107f4133822","resolution":{"observed_at":"2026-08-05T17:50:42.779456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:42.808173Z","title":"Decoupled momentum optimization.arXiv preprint arXiv:2411.19870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.808173Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:e811f8544685981f4c0bff5bc27adfc8ecf15ea2aa75a1937031e7d6dcbe0086","observation_id":"a3705fd5-2814-4ef8-82cf-5495a7ca8831","resolution":{"observed_at":"2026-08-05T17:50:42.808173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01152","last_updated":"2024-12-02T05:52:32Z","snapshot_observed_at":"2026-08-14T20:08:24.706727Z","submitted_at":"2024-12-02T05:52:32Z","title":"INTELLECT-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01152","snapshot_observed_at":"2026-08-05T17:50:42.668228Z","title":"INTELLECT-1 technical report.CoRR, abs/2412.01152,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.668228Z"},"links":{"cited_paper":"/paper/2412.01152","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:8edc2cecce58bce089d30c5e6d8b78990aaceddbd769c8d93eebe7c6ba48dd6e","observation_id":"e163af05-5ad3-4b11-9034-c2322da03950","resolution":{"observed_at":"2026-08-05T17:50:42.668228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17517","last_updated":"2024-05-27T09:02:57Z","snapshot_observed_at":"2026-08-14T13:56:29.942885Z","submitted_at":"2024-05-27T09:02:57Z","title":"WASH: Train your Ensemble with Communication-Efficient Weight Shuffling, then Average","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17517","snapshot_observed_at":"2026-08-05T17:50:42.528727Z","title":"Louis Fournier, Adel Nabli, Masih Aminbeidokhti, Marco Pedersoli, Eugene Belilovsky, and Edouard Oyallon","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.528727Z"},"links":{"cited_paper":"/paper/2405.17517","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:e8e04a2adc04ad9277cb3072ce5a59329b28d29457a54cb18acf0575982e6d73","observation_id":"2f595d93-b45a-42a4-8cd5-f81b06ca3339","resolution":{"observed_at":"2026-08-05T17:50:42.528727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-13T05:25:41.304635Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T17:50:42.327928Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.327928Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:3ae2a7f8c6f352cb4704fc59711f562823bafac00fef59f8a1436a4f5e885a0c","observation_id":"56cd2afe-9f0a-41fd-a231-e5696fb4f400","resolution":{"observed_at":"2026-08-05T17:50:42.327928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:42.224878Z","title":"Debraj Basu, Deepesh Data, Can Karakus, and Suhas Diggavi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.224878Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:d43f83aa409bef28aa33d033f0eaca4a167a9243f08f1adff704d7a103380b84","observation_id":"89ce55a4-0b28-47c8-a9b6-6077f25d8c10","resolution":{"observed_at":"2026-08-05T17:50:42.224878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T03:36:29.307587Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 9 inbound Pith citation observations for arXiv:2508.15706."}