{"as_of":"2026-08-09T19:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d88b020a2a52885051d79178330a42871d95ace09db9d95c9a0ee17c4a4c2ae","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:45:00.694739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T15:45:00.694739Z","title":"Rusu, Rachita Chhaparia, Yani Donchev, Adhiguna Kuncoro, Marc'Aurelio Ranzato, Arthur Szlam, and Jiajun Shen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14065","last_updated":"2025-05-20T08:11:42Z","snapshot_observed_at":"2026-08-09T09:18:44.023984Z","submitted_at":"2025-05-20T08:11:42Z","title":"Prime Collective Communications Library -- Technical Report","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:45:00.694739Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.14065"},"observation_digest":"sha256:b59f35b63b684c59805d0126329c71c111c277794d577974fb4a7584b11f7fb8","observation_id":"15ad925d-b52d-460d-877d-99fbcae9f9fa","resolution":{"observed_at":"2026-08-07T15:45:00.694739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T13:30:19.164843Z","title":"Diloco: Distributed low- communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21684","last_updated":"2025-05-27T19:11:22Z","snapshot_observed_at":"2026-08-07T19:56:38.719142Z","submitted_at":"2025-05-27T19:11:22Z","title":"Incentivizing Permissionless Distributed Learning of LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.164843Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.21684"},"observation_digest":"sha256:5a8127aea7f533a91ac6da3d140211a10a3b8d5ec2772b0ea2d938736bcf0dbb","observation_id":"071f1e30-5c6f-4492-bf64-3c50eca7c604","resolution":{"observed_at":"2026-08-07T13:30:19.164843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T13:13:21.194758Z","title":"Douillard, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22549","last_updated":"2025-05-28T16:32:33Z","snapshot_observed_at":"2026-08-09T15:57:12.071768Z","submitted_at":"2025-05-28T16:32:33Z","title":"DES-LOC: Desynced Low Communication Adaptive Optimizers for Training Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:21.194758Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.22549"},"observation_digest":"sha256:d20d7655577452db1dce53b92edd9023a01a5c63dec96319058d196ec39268c2","observation_id":"ec5ff9dd-d323-429c-b9ae-5d73bd6acdd0","resolution":{"observed_at":"2026-08-07T13:13:21.194758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T12:45:26.610592Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-07T12:36:41.591936Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.610592Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.23725"},"observation_digest":"sha256:63f159c6f06b4f42a2455220a742eed30d49b1cd9fd5a084fcd71153e14e1c63","observation_id":"4449a919-5659-43e7-bf23-9d0dc44eb9a2","resolution":{"observed_at":"2026-08-07T12:45:26.610592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T11:55:13.360801Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.360801Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:8da918ea6f70455e69730d9be7b30ada91168fd74a4bdbcd66256ae719917547","observation_id":"6e906f3c-ff5a-495d-ab76-86472ce8777e","resolution":{"observed_at":"2026-08-07T11:55:13.360801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T11:17:08.727540Z","title":"https://arxiv.org/abs/2311.08105","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02965","last_updated":"2025-06-04T05:38:31Z","snapshot_observed_at":"2026-08-09T17:21:55.395441Z","submitted_at":"2025-06-03T15:00:18Z","title":"PC-MoE: Memory-Efficient and Privacy-Preserving Collaborative Training for Mixture-of-Experts LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:08.727540Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.02965"},"observation_digest":"sha256:56c15e84c73e14404288759f29b9a13066b60328d93cfa1d103cab067ebe9f59","observation_id":"76f073f6-21b1-4e85-aabd-74f486939cb4","resolution":{"observed_at":"2026-08-07T11:17:08.727540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T10:46:06.468296Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-09T03:17:02.325152Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.468296Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:231ef4da50641062980dc0725c550698ad0dfbaa6e2178ab4905eba8c8336ccc","observation_id":"416f7470-76d8-4077-8710-3ab49683b68f","resolution":{"observed_at":"2026-08-07T10:46:06.468296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T04:20:01.338312Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-08T07:52:54.572018Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.338312Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:21393a8ae93de4778d642ea639c7c85d7d479ed5d96827dc51cb0c5f6bbb5445","observation_id":"407c224f-5d82-43e0-9a22-a0ba775b36cf","resolution":{"observed_at":"2026-08-07T04:20:01.338312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T22:40:13.436255Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.436255Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:7796d6e144619c75b41bde746902795a9e21cbadb84019f0c838e36b0d460e31","observation_id":"8549cf5b-dd06-4a11-98b6-9f82744c914d","resolution":{"observed_at":"2026-08-06T22:40:13.436255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2507.06542","last_updated":"2026-04-27T10:34:05Z","snapshot_observed_at":"2026-08-06T23:52:48.965163Z","submitted_at":"2025-07-09T04:56:56Z","title":"On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T05:39:53.088948Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.06542"},"observation_digest":"sha256:c5b67328331881a4d6a075a3049a01821b8ebbe2184dbfd5655095d867e52cb4","observation_id":"547be796-941e-40ce-aa18-496d59b245c6","resolution":{"observed_at":"2026-05-19T05:42:06.087985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T19:00:00.918889Z","title":"Diloco: Distributed low- communication training of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06931","last_updated":"2025-07-09T15:13:44Z","snapshot_observed_at":"2026-08-09T09:18:31.628544Z","submitted_at":"2025-07-09T15:13:44Z","title":"DICE: Data Influence Cascade in Decentralized Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:00.918889Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.06931"},"observation_digest":"sha256:180b4fea90ad0b92fa5e907dd53be47075f7bbf42f08f1f4f6f5156041f20f44","observation_id":"4581f219-a55e-46eb-8f6f-dac9a32201d5","resolution":{"observed_at":"2026-08-06T19:00:00.918889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T18:37:45.531277Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07765","last_updated":"2025-07-10T13:43:15Z","snapshot_observed_at":"2026-08-09T02:35:09.386053Z","submitted_at":"2025-07-10T13:43:15Z","title":"Distributed and Decentralised Training: Technical Governance Challenges in a Shifting AI Landscape","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:37:45.531277Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.07765"},"observation_digest":"sha256:53a686aeb8ce27c6f5fabe9ae68dda7bff7c4c6177c5aa86c0781a9b9f161712","observation_id":"ef29e758-7d1f-40ed-898a-be261a4fc9a9","resolution":{"observed_at":"2026-08-06T18:37:45.531277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T18:19:59.333518Z","title":"Douillard, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09029","last_updated":"2026-05-31T02:40:58Z","snapshot_observed_at":"2026-08-09T07:04:00.337129Z","submitted_at":"2025-07-11T21:25:11Z","title":"Model Parallelism With Subnetwork Data Parallelism","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.333518Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.09029"},"observation_digest":"sha256:020068658123416edd285274dd034d76c4a793022eb8b57f0424e4bf3d54fbf9","observation_id":"ee585c18-0e62-4758-9dbe-f2062d9917bb","resolution":{"observed_at":"2026-08-06T18:19:59.333518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T17:52:50.265538Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10618","last_updated":"2025-07-13T21:28:02Z","snapshot_observed_at":"2026-08-08T03:18:40.989863Z","submitted_at":"2025-07-13T21:28:02Z","title":"Compute Requirements for Algorithmic Innovation in Frontier AI Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:50.265538Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.10618"},"observation_digest":"sha256:8ba646b77d82825372cb84232ae495d5f8ca028a1613ab263b5d891301391db0","observation_id":"719527bf-0822-43b7-ac90-8e208eac7646","resolution":{"observed_at":"2026-08-06T17:52:50.265538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T17:50:42.327928Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.327928Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:1b026e1b66f557e414acf50c7ab25372bc07408691af985a332b1ec1b58cfb0f","observation_id":"56cd2afe-9f0a-41fd-a231-e5696fb4f400","resolution":{"observed_at":"2026-08-05T17:50:42.327928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T16:36:50.502069Z","title":"Rusu, Rachita Chhaparia, Yani Donchev, Adhiguna Kuncoro, Marc'Aurelio Ranzato, Arthur Szlam, and Jiajun Shen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18182","last_updated":"2025-08-25T16:35:57Z","snapshot_observed_at":"2026-08-05T16:36:35.157558Z","submitted_at":"2025-08-25T16:35:57Z","title":"AdLoCo: adaptive batching significantly improves communications efficiency and convergence for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T16:36:50.502069Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2508.18182"},"observation_digest":"sha256:dbb89748efdbb181915a6b5ee8a8fa1007a9429315fd5a79cc32683960384e25","observation_id":"d20fa830-0265-4a0b-8cef-3700bff4f7c1","resolution":{"observed_at":"2026-08-05T16:36:50.502069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-04T12:37:33.139636Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03434","last_updated":"2026-07-31T16:40:13Z","snapshot_observed_at":"2026-08-08T01:35:00.151253Z","submitted_at":"2025-10-03T18:53:12Z","title":"Paris: A Decentralized Trained Open-Weight Diffusion Model","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:33.139636Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2510.03434"},"observation_digest":"sha256:e38aaee3ac866aed1d511a175bb0d9d7f7f436067157940dab3169707144a425","observation_id":"735fd172-a4bc-4a6b-a7b2-3b5eb52e84cb","resolution":{"observed_at":"2026-08-04T12:37:33.139636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-03T21:00:25.350044Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19468","last_updated":"2026-06-17T09:31:06Z","snapshot_observed_at":"2026-08-07T23:52:50.602231Z","submitted_at":"2025-11-22T00:28:08Z","title":"Towards a future space-based, highly scalable AI infrastructure system design","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:00:25.350044Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2511.19468"},"observation_digest":"sha256:66bcf34ce334e857bbbc988376d855ced15bd7a653706096d273cb4ff48479c2","observation_id":"ee686517-8e08-47fb-bea2-93f0aa6fde3e","resolution":{"observed_at":"2026-08-03T21:00:25.350044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2601.21972","last_updated":"2026-05-26T15:41:11Z","snapshot_observed_at":"2026-08-03T06:46:35.623443Z","submitted_at":"2026-01-29T16:50:30Z","title":"Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T09:47:47.051969Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2601.21972"},"observation_digest":"sha256:ad4329be8c4bbe3cf7ecc3e135cc11b65d9d322aa70aecc3d7bb24f790e4e312","observation_id":"8affa5a0-6c2d-45ed-b5c8-488d36d803c2","resolution":{"observed_at":"2026-05-16T09:50:49.408158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-03T06:46:38.886381Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21972","last_updated":"2026-05-26T15:41:11Z","snapshot_observed_at":"2026-08-03T06:46:35.623443Z","submitted_at":"2026-01-29T16:50:30Z","title":"Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:38.886381Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2601.21972"},"observation_digest":"sha256:23ac8c57fe0ce1e37adc9c7056fca609b9449227c531641dbbadab860434db23","observation_id":"14ec8947-395e-4b2e-8ba7-f4de7bc932a9","resolution":{"observed_at":"2026-08-03T06:46:38.886381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-03T04:44:55.319460Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04396","last_updated":"2026-06-17T18:22:54Z","snapshot_observed_at":"2026-08-08T18:55:31.308399Z","submitted_at":"2026-02-04T10:25:24Z","title":"LoRDO: Distributed Low-Rank Optimization with Infrequent Communication","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:44:55.319460Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2602.04396"},"observation_digest":"sha256:2f09046e6709746ce1f9154af5f5a8ece01e6779da392c8e31d96915779dc7bd","observation_id":"60c3ecbb-c895-41d5-9e0d-221fa60f8ccb","resolution":{"observed_at":"2026-08-03T04:44:55.319460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2604.21072","last_updated":"2026-05-05T16:09:43Z","snapshot_observed_at":"2026-07-06T23:07:41.856444Z","submitted_at":"2026-04-22T20:36:47Z","title":"Distributed Generative Inference of LLM at Internet Scales with Multi-Dimensional Communication Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T23:01:56.712670Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2604.21072"},"observation_digest":"sha256:8707711e49c97b4b8fc275d97c2a2559323ce07e7fc610c844718f04d36ebeef","observation_id":"d1c9f7f1-8bbe-4e3c-baf0-9adfa6831473","resolution":{"observed_at":"2026-05-09T23:04:17.846136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2604.24708","last_updated":"2026-04-27T17:17:28Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:17:28Z","title":"Scalable Hyperparameter-Divergent Ensemble Training with Automatic Learning Rate Exploration for Large Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T04:08:25.530778Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2604.24708"},"observation_digest":"sha256:49a960a33dfa2601d45fc10392d6a6624e256344214d8d0500dba39926219631","observation_id":"669f8d3c-b7c6-48da-a9fa-389612f0a24d","resolution":{"observed_at":"2026-05-11T21:51:20.305569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.08871","last_updated":"2026-05-09T10:46:59Z","snapshot_observed_at":"2026-07-31T15:53:03.039634Z","submitted_at":"2026-05-09T10:46:59Z","title":"Rennala MVR: Improved Time Complexity for Parallel Stochastic Optimization via Momentum-Based Variance Reduction","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T01:51:20.003552Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.08871"},"observation_digest":"sha256:093811544fdc558bb4499743f77db2c94fa0de784f5f7c7ed7c20dfd48978f0a","observation_id":"7d01d556-d04a-45ed-b874-a4ebec0d0f21","resolution":{"observed_at":"2026-05-12T07:51:31.493255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.09126","last_updated":"2026-05-09T19:16:29Z","snapshot_observed_at":"2026-08-04T17:08:40.060316Z","submitted_at":"2026-05-09T19:16:29Z","title":"Cosine-Gated Adam-Decay: Drop-In Staleness-Aware Outer Optimization for Decoupled DiLoCo","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:11.470788Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.09126"},"observation_digest":"sha256:7f653a21819b42a7cac5bdacc4988a70c88262ee72348386142d96b388df950a","observation_id":"da34be27-988f-409b-83a0-7ec12094c728","resolution":{"observed_at":"2026-05-12T02:31:16.903062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.11172","last_updated":"2026-05-11T19:30:47Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:30:47Z","title":"Optimistic Dual Averaging Unifies Modern Optimizers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:52:16.805180Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.11172"},"observation_digest":"sha256:d97229f35b0ab5591730323671824a761088b00a0021117a6bff515d446855a3","observation_id":"4e08d48d-d067-4fd7-8043-523dfc129b2f","resolution":{"observed_at":"2026-05-13T05:52:21.837939Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.19095","last_updated":"2026-05-18T20:31:49Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:31:49Z","title":"ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T12:22:30.263086Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.19095"},"observation_digest":"sha256:e0320cc9f9fcb79b9da9412c533dbac0be0c1ef2bb93b7684e10948e75c093d1","observation_id":"0dbb234a-1f2d-48ae-8b63-af31aca8ebeb","resolution":{"observed_at":"2026-05-20T12:23:16.790219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.24326","last_updated":"2026-05-23T01:11:19Z","snapshot_observed_at":"2026-07-06T23:34:23.087565Z","submitted_at":"2026-05-23T01:11:19Z","title":"ScaleAcross Explorer: Exploring Communication Optimization for Scale-Across AI Model Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T12:57:37.344369Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.24326"},"observation_digest":"sha256:6161e8ef1df500af20086e36624238d787872604fa1ce9522faf051ca316439f","observation_id":"f2347315-cd60-43e8-ad4c-7105119d1cd7","resolution":{"observed_at":"2026-06-30T13:04:40.496903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.28585","last_updated":"2026-05-27T15:09:02Z","snapshot_observed_at":"2026-08-07T06:12:39.413721Z","submitted_at":"2026-05-27T15:09:02Z","title":"Outer-Momentum Restarting in High-Dimensional Two-Phase Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:31:23.664332Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.28585"},"observation_digest":"sha256:f4aa17b4aa8b72fad1df4374c2e33a868586cad96d4b6875ef3cde24f9cb3dec","observation_id":"a9082207-48d1-4bc4-b2f5-e4ba2ba2779c","resolution":{"observed_at":"2026-06-29T13:33:27.499368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.01128","last_updated":"2026-05-31T10:02:15Z","snapshot_observed_at":"2026-08-07T15:58:31.574574Z","submitted_at":"2026-05-31T10:02:15Z","title":"Local MixVR: Breaking the Communication-Sample Dependence in Distributed Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:22:36.503465Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.01128"},"observation_digest":"sha256:c9d1410dcd358666d50bfd33da2e421c953a3b05463596da5c8464fc9694d0a3","observation_id":"89e02c70-d3cc-40a7-a260-fd4ab45ed7d0","resolution":{"observed_at":"2026-07-01T21:16:14.072138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.02958","last_updated":"2026-06-01T23:28:29Z","snapshot_observed_at":"2026-07-06T23:43:17.879245Z","submitted_at":"2026-06-01T23:28:29Z","title":"Echelon: Auditable Aggregate-Only Language-Model Adaptation Across Privacy Boundaries","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T13:38:48.333498Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.02958"},"observation_digest":"sha256:872eb1c2935a66594be568dcdc8cb59233062cef29e7aff5885250b84dc7b7f7","observation_id":"e18b6555-34f8-4f6c-96e7-27c2a768b362","resolution":{"observed_at":"2026-07-02T00:06:23.646181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.05484","last_updated":"2026-06-03T22:10:16Z","snapshot_observed_at":"2026-08-08T18:26:57.970156Z","submitted_at":"2026-06-03T22:10:16Z","title":"Learned Subspace Compression for Communication-Efficient Pipeline Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:58.301482Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.05484"},"observation_digest":"sha256:991fa9813f6ae1d4389708afa7e4ffbe30c1a5923ff21d1e94ec3995d34459a4","observation_id":"cbdf6fdf-bd18-4ff0-8067-26d1d8d21a0d","resolution":{"observed_at":"2026-07-02T07:46:46.170228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.11081","last_updated":"2026-06-09T16:40:54Z","snapshot_observed_at":"2026-08-03T08:40:34.396170Z","submitted_at":"2026-06-09T16:40:54Z","title":"Unifying Local Communications and Local Updates for LLM Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T14:07:42.062805Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.11081"},"observation_digest":"sha256:e55901ff9711f75829b37f4b0d146de93d9859f4ea146f676f5f8b8e053da623","observation_id":"6c2cffcd-d7b8-49f4-a770-06a1de08f54f","resolution":{"observed_at":"2026-07-03T04:07:37.145086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.19025","last_updated":"2026-06-20T12:18:17Z","snapshot_observed_at":"2026-08-04T11:35:50.051001Z","submitted_at":"2026-06-17T12:50:07Z","title":"FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:15.709652Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.19025"},"observation_digest":"sha256:3d82e160082bbd0b7daa80b9944f89050277bb2fcebd050c20310c7d63257473","observation_id":"a21a84fc-055c-42ac-af50-6b1ca4ac5690","resolution":{"observed_at":"2026-06-26T21:30:02.824990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.24942","last_updated":"2026-06-22T20:50:05Z","snapshot_observed_at":"2026-08-02T03:45:42.319310Z","submitted_at":"2026-06-22T20:50:05Z","title":"Quantum-Resilient Decentralized AI Economies: Proof-of-Useful-Work and Post-Quantum Security","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T07:34:47.006198Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.24942"},"observation_digest":"sha256:063eb70dfd572e6da5cd02aae4f02778a119a00c584176187938e94282301717","observation_id":"da0efcae-8cec-4d96-94fd-204f83bcd174","resolution":{"observed_at":"2026-07-04T11:49:50.890394Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-07-12T12:16:10.904456Z","title":"and Chhaparia, Rachita and Donchev, Yani and Kuncoro, Adhiguna and Ranzato, Marc'Aurelio and Szlam, Arthur and Shen, Jiajun , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02544","last_updated":"2026-06-24T05:57:19Z","snapshot_observed_at":"2026-08-09T02:27:02.251729Z","submitted_at":"2026-06-24T05:57:19Z","title":"Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-12T12:16:10.904456Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.02544"},"observation_digest":"sha256:737c429a7ba7f6dc0ac1e4ccd1ad0d203e379945ded9ae02744ece044b807762","observation_id":"49c6774a-1edd-4d97-bfe8-5f87a536ef4a","resolution":{"observed_at":"2026-07-12T12:16:10.904456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-07-14T12:46:51.615514Z","title":"Rusu, Rachita Chhaparia, Yani Donchev, Adhiguna Kuncoro, Marc’Aurelio Ranzato, Arthur Szlam, and Jiajun Shen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10305","last_updated":"2026-07-11T13:23:06Z","snapshot_observed_at":"2026-08-03T02:30:45.447762Z","submitted_at":"2026-07-11T13:23:06Z","title":"Byzantine Accountability Without Consensus: Strong Eventual Consistency for Non-Associative, Stochastic, Robust Aggregation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T12:46:51.615514Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.10305"},"observation_digest":"sha256:c645aef724a8b2e06282cfa513e5eac9bc4ec25881334274f62f94a5a1946bc6","observation_id":"f05a57ea-6304-4234-a165-48f9392853ae","resolution":{"observed_at":"2026-07-14T12:46:51.615514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-02T01:23:30.172502Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023.(Cited on pages 2, 3, and 5)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14731","last_updated":"2026-07-16T08:56:45Z","snapshot_observed_at":"2026-08-03T18:32:12.673941Z","submitted_at":"2026-07-16T08:56:45Z","title":"What's in a Smoothness Constant? Tighter Rates for Local SGD with Bounded Second-order Heterogeneity","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:23:30.172502Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.14731"},"observation_digest":"sha256:1a6ea84b43777eb54ee92826ee39f97ae5b96d1ac5da8a843b507035cdfe7c6c","observation_id":"2148f948-01ab-44ea-bc42-d3748978e21f","resolution":{"observed_at":"2026-08-02T01:23:30.172502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-01T17:36:03.863586Z","title":"arXiv preprint arXiv:2311.08105 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18343","last_updated":"2026-07-20T07:03:03Z","snapshot_observed_at":"2026-08-08T12:32:23.192042Z","submitted_at":"2026-07-20T07:03:03Z","title":"Federated Lightweight Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:36:03.863586Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.18343"},"observation_digest":"sha256:540108cb7480b42a2f609d2a983cd2e3a2298d1b398d59a655fe2739d36d5088","observation_id":"19bc8e28-174c-4e81-9325-4f63e772b91f","resolution":{"observed_at":"2026-08-01T17:36:03.863586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-01T08:10:51.408706Z","title":"Douillard, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21224","last_updated":"2026-07-23T11:39:21Z","snapshot_observed_at":"2026-08-08T02:24:03.880963Z","submitted_at":"2026-07-23T11:39:21Z","title":"Controlled Periodic Synchronization for Efficient Data-Parallel Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T08:10:51.408706Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.21224"},"observation_digest":"sha256:a0ba7b3c7319567c67f4eb8814978da89cf60c81ad176d8e71a30e8fe799b2f4","observation_id":"6bfc9d83-eeff-4b6c-96eb-2155984c6f95","resolution":{"observed_at":"2026-08-01T08:10:51.408706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.08105/citation-record","integrity":"/paper/2311.08105/integrity","json":"/paper/2311.08105/citation-record.json","paper":"/paper/2311.08105"},"outbound":[],"paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2311.08105."}