{"as_of":"2026-08-10T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36fc96e72bb5f19a74faa4c6503140682725954c9f49f9349de2a7c76cb14b0c","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:40:13.785408Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:44:55.885810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:15.165598Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21263","snapshot_observed_at":"2026-08-03T04:44:55.885810Z","title":"Dilocox: A low- communication large-scale training framework for de- centralized cluster.arXiv preprint arXiv:2506.21263,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04396","last_updated":"2026-06-17T18:22:54Z","snapshot_observed_at":"2026-08-08T18:55:31.308399Z","submitted_at":"2026-02-04T10:25:24Z","title":"LoRDO: Distributed Low-Rank Optimization with Infrequent Communication","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:44:55.885810Z"},"links":{"cited_paper":"/paper/2506.21263","citing_paper":"/paper/2602.04396"},"observation_digest":"sha256:e790f220f7a527e0b10274ca183fa9a07e017f551d88a2cb3ebf3305ecf1ecf3","observation_id":"b0a1f4a5-444f-4928-a0d5-0d7f644bc7cd","resolution":{"observed_at":"2026-08-03T04:44:55.885810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"cited_work":{"arxiv_id":"2506.21263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21263","snapshot_observed_at":"2026-07-04T00:09:15.165598Z","title":"Dilocox: A low-communication large-scale training framework for decentralized cluster","venue":null,"work_id":"feb78ab9-3fcb-46a2-b91a-3e91b0ec274b","year":2025},"citing_paper":{"arxiv_id":"2606.19025","last_updated":"2026-06-20T12:18:17Z","snapshot_observed_at":"2026-08-04T11:35:50.051001Z","submitted_at":"2026-06-17T12:50:07Z","title":"FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs","version":2},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:15.709652Z"},"links":{"cited_paper":"/paper/2506.21263","citing_paper":"/paper/2606.19025"},"observation_digest":"sha256:2090f3b061feeb00dba35758a93d0287d955785be1166dc0e9d1b77a9ad978f1","observation_id":"fbed2714-ad13-42f6-a330-a1da3b15ba6f","resolution":{"observed_at":"2026-07-04T00:09:15.167756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21263/citation-record","integrity":"/paper/2506.21263/integrity","json":"/paper/2506.21263/citation-record.json","paper":"/paper/2506.21263"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T22:40:13.252709Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.252709Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:ecb05dfcd911c5d64e7c2770adb0ad85de27738b9640f43bbff8b2f6fc5438e0","observation_id":"9f1c84f6-ffa4-4f9d-84b9-0eaef4e66dff","resolution":{"observed_at":"2026-08-06T22:40:13.252709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T22:40:13.436255Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.436255Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:7796d6e144619c75b41bde746902795a9e21cbadb84019f0c838e36b0d460e31","observation_id":"8549cf5b-dd06-4a11-98b6-9f82744c914d","resolution":{"observed_at":"2026-08-06T22:40:13.436255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:13.523444Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.523444Z"},"links":{"citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:663bba7b499f52f8ef2ee4c60bfe828ebfc94cd8add9d29bf8dadb8bf33b4dd0","observation_id":"9528fa99-09b1-4bc9-a50c-3542a360415f","resolution":{"observed_at":"2026-08-06T22:40:13.523444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13727","last_updated":"2020-02-18T14:13:56Z","snapshot_observed_at":"2026-08-03T23:32:37.116762Z","submitted_at":"2019-05-31T17:25:13Z","title":"PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13727","snapshot_observed_at":"2026-08-06T22:40:13.682045Z","title":"Wang, H., Li, J., Wu, H., Hovy, E., and Sun, Y","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.682045Z"},"links":{"cited_paper":"/paper/1905.13727","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:a92f249ab6414cf3fc3a05c6d0ba2209458a88b7b4c91360fd89e226aa86eb90","observation_id":"d415e8e9-6869-43ef-a2e7-c0c0f9839eca","resolution":{"observed_at":"2026-08-06T22:40:13.682045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00119","last_updated":"2022-10-28T15:55:09Z","snapshot_observed_at":"2026-07-06T13:05:19.702730Z","submitted_at":"2022-04-30T00:55:29Z","title":"MiCS: Near-linear Scaling for Training Gigantic Model on Public Cloud","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00119","snapshot_observed_at":"2026-08-06T22:40:13.736781Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.736781Z"},"links":{"cited_paper":"/paper/2205.00119","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:e6800fe695b2d63ea4c15572e1c402fe0d731493654c87d8f4bd20c131b39e84","observation_id":"eb6af78d-5f49-40b9-a22b-54d9e8126298","resolution":{"observed_at":"2026-08-06T22:40:13.736781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T22:40:13.785408Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y ., Min, Y ., Zhang, B., Zhang, J., Dong, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.785408Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:31edb57bfcc6874be539f635a2b26224bcf3220f406fd8bada25507dfc62345d","observation_id":"c16f3d0b-5aef-4d2a-bdf0-057f4e63b042","resolution":{"observed_at":"2026-08-06T22:40:13.785408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-06T22:40:13.565214Z","title":"Merity, S., Xiong, C., Bradbury, J., and Socher, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.565214Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:9c3f36af3b80d166e57f7a075bef82bda62aead117b4965b72806f590b78a401","observation_id":"de7a93ad-a5ca-4838-8bd9-30373a58e329","resolution":{"observed_at":"2026-08-06T22:40:13.565214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T22:40:13.643058Z","title":"Megatron-lm: Training multi- billion parameter language models using model paral- lelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.643058Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:16a68129d01c68b0f26f0d5015d3a1dfc23b4ed5193c40bb414ed70fef86117f","observation_id":"eb463f6f-dc62-4044-8e27-e1a66ea2f5e7","resolution":{"observed_at":"2026-08-06T22:40:13.643058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02132","last_updated":"2017-12-06T18:28:32Z","snapshot_observed_at":"2026-07-06T05:13:43.147966Z","submitted_at":"2016-10-07T03:44:34Z","title":"QSGD: Communication-Efficient SGD via Gradient Quantization and Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02132","snapshot_observed_at":"2026-08-06T22:40:13.136132Z","title":"Alistarh, D., Hoefler, T., Johansson, M., Khirirat, S., Kon- stantinov, N., and Renggli, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.136132Z"},"links":{"cited_paper":"/paper/1610.02132","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:708a2ae4d49c355a276ca1148df191654d7462d6cb43d4e1698db6e251253c8d","observation_id":"a9fc2713-726f-4861-b362-8801425a4c50","resolution":{"observed_at":"2026-08-06T22:40:13.136132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10505","last_updated":"2018-09-27T13:23:35Z","snapshot_observed_at":"2026-07-06T07:04:39.537654Z","submitted_at":"2018-09-27T13:23:35Z","title":"The Convergence of Sparsified Gradient Methods","version":1},"cited_work":{"arxiv_id":"1809.10505","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.10505","snapshot_observed_at":"2026-08-06T22:40:13.907534Z","title":"The Convergence of Sparsified Gradient Methods","venue":"cs.LG","work_id":"e0086c1a-f9f5-48b6-a904-0ea250191b63","year":2018},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.176409Z"},"links":{"cited_paper":"/paper/1809.10505","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:8c9ed1800f3dd48bf4d154a735a19b24dc9b508b3b01448bea06a17794a6532f","observation_id":"852583dd-5db7-4651-bb32-9c0f5fc3dbce","resolution":{"observed_at":"2026-08-06T22:40:14.005772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-06T22:40:13.598804Z","title":"Rendle, S., Fetterly, D., Shekita, E","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.598804Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:accff9752fe5aad8b92ff90ef59d2d9c58dc1fe4ba3ccfbe0dbb3b6a628e181b","observation_id":"b427e7c6-2ce3-4342-9304-8d57dd793cc9","resolution":{"observed_at":"2026-08-06T22:40:13.598804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T22:40:13.301213Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.301213Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:e84bee29be6837c2842428173b7170b0bc105f660c393ba378973a9439f323ee","observation_id":"d2c398b0-ccde-41b9-9fdb-27c90be31eab","resolution":{"observed_at":"2026-08-06T22:40:13.301213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07852","last_updated":"2024-07-10T17:13:17Z","snapshot_observed_at":"2026-08-03T21:39:52.555111Z","submitted_at":"2024-07-10T17:13:17Z","title":"OpenDiLoCo: An Open-Source Framework for Globally Distributed Low-Communication Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07852","snapshot_observed_at":"2026-08-06T22:40:13.488227Z","title":"M., and Hagemann, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.488227Z"},"links":{"cited_paper":"/paper/2407.07852","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:17ed4158a71b4c9f8659e1b123c1bbd405b3e744b82a59b896b43ea98fa3b900","observation_id":"7db6d8c9-3376-48a1-8d07-981a35e2727e","resolution":{"observed_at":"2026-08-06T22:40:13.488227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T22:40:13.370660Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.370660Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:3c911f6d61f3de923a12ef1aa7bf5a52733747aacdf078454b804abf51874017","observation_id":"7d3cf74f-3194-43f7-bcfe-54803e81582a","resolution":{"observed_at":"2026-08-06T22:40:13.370660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T13:12:30.046641Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 2 inbound Pith citation observations for arXiv:2506.21263."}