{"as_of":"2026-08-18T21:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0981ec2189c26fcec2fd9d55b2593f05d170b0babe9435b6fa8421679d490302","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:46:06.685339Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04531/citation-record","integrity":"/paper/2506.04531/integrity","json":"/paper/2506.04531/citation-record.json","paper":"/paper/2506.04531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.420751Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.420751Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9e50b285bd60c2ec1f0c6fc68d68ca2e13ed2c35c81887e9c904ae8c8a7af025","observation_id":"2ac87bf3-fe11-4f5d-8145-440dab3a0dab","resolution":{"observed_at":"2026-08-07T10:46:06.420751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:46:06.426612Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.426612Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:486db863f3ebfd88c0127024e0029eb7cdedbcfbcd862435cae42aa6bbc19fbc","observation_id":"f8f47d13-e59b-45e4-afae-347526e25eb3","resolution":{"observed_at":"2026-08-07T10:46:06.426612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.555712Z","title":"On the choice of learning rate for local sgd","venue":null,"work_id":"9b7f30cb-96d7-46bb-aadd-11e8c2b609bd","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.432013Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:2dd6cb76cc47aa22daa2c14ec30a8476891911ebfddd9b18e99371fd77db3fe4","observation_id":"00f16575-a363-4033-aff5-1b339f2a1de0","resolution":{"observed_at":"2026-08-07T10:46:07.560463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.436385Z","title":"G., Bradley, H., O’Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.436385Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:d5190fd78a64d9b757d5c211b0180a395fad2ebeb25af907e76c7d4a2cf42ceb","observation_id":"26ecb27f-ed11-4482-816d-2a24f0bbebf8","resolution":{"observed_at":"2026-08-07T10:46:06.436385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.441028Z","title":"L., Gao, J., and Choi, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.441028Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:becb54594d3405124844d87514860b105f3c740073012af0d83314d18ea05e96","observation_id":"ec89d5cc-1f69-444d-ab7e-2d9f9a34faf3","resolution":{"observed_at":"2026-08-07T10:46:06.441028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01097","last_updated":"2019-12-09T20:02:37Z","snapshot_observed_at":"2026-08-16T19:49:29.879809Z","submitted_at":"2018-12-03T21:59:41Z","title":"LEAF: A Benchmark for Federated Settings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01097","snapshot_observed_at":"2026-08-07T10:46:06.445477Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.445477Z"},"links":{"cited_paper":"/paper/1812.01097","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:74386603452db72e9a50bc2560084ba2f70363f50a64764a78af08027b3b6c18","observation_id":"68dc5e3c-4d4b-48ce-9f99-9ee51f8cd146","resolution":{"observed_at":"2026-08-07T10:46:06.445477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.524933Z","title":"Multi-level local sgd: Distributed sgd for heterogeneous hierarchical networks","venue":null,"work_id":"8590e5de-8fb8-4a38-b0c7-9bbf0a1ff0fa","year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.450151Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:fdb2b5570f058b5b8043d2da8d3d6b53748324c6cae09c8815ecc8da890107e3","observation_id":"90e05d00-5118-4e00-914e-ad30f66d0988","resolution":{"observed_at":"2026-08-07T10:46:07.529418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.511524Z","title":"Asynchronous online federated learning for edge devices with non-iid data","venue":null,"work_id":"4038764c-cc5d-4a62-9c3b-97981e1ca5b1","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.454938Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:44749aaa6ec62c057abecdc26f88426e1bdc4be2be1ea40f44a9537ab3eef834","observation_id":"d9442a6c-000d-48d4-b524-fa4aa748ada1","resolution":{"observed_at":"2026-08-07T10:46:07.515918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T10:46:06.459202Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.459202Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:899ce858bd2912831da034e941f90fc10345af4c153d5537c34177eaae3629cf","observation_id":"e39444a7-3c0f-43aa-ac33-9e6a5203e745","resolution":{"observed_at":"2026-08-07T10:46:06.459202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.496887Z","title":"Large scale distributed deep networks","venue":null,"work_id":"8add0219-4602-4e80-9add-fb61288007c7","year":2012},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.463751Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:2cf1225cd784d514184987b8ecab1e745aa5bf308bd3ac36494bcbf8355686d4","observation_id":"dad22139-1e59-466c-b8e4-2e8b4ae64195","resolution":{"observed_at":"2026-08-07T10:46:07.502116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-18T20:33:44.932427Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T10:46:06.468296Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.468296Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:4cca47be1f0fc387737d0a684de6d4c6db5841c5cf68251cd37789d56f8171bb","observation_id":"416f7470-76d8-4077-8710-3ab49683b68f","resolution":{"observed_at":"2026-08-07T10:46:06.468296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:46:06.472885Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.472885Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:238d66b1ab0de19d215e6178a824d188225a62ecebc312e4fce6d85fbe2f5507","observation_id":"b3e578e4-b346-4654-964f-47b0319965b9","resolution":{"observed_at":"2026-08-07T10:46:06.472885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.477265Z","title":"N., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.477265Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9dc970648883a0c47726cb42fb5cdfda5065135d4f05b678ce518ea0b13db4eb","observation_id":"2ecc8cc8-b082-43c9-858f-98285f36c311","resolution":{"observed_at":"2026-08-07T10:46:06.477265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T10:46:06.481712Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.481712Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:2ee43ef828dcb231d96649c2cb382cd227960c0c7ea2808af9b57caa5f71c06e","observation_id":"1926c09d-f5c9-4036-86f2-f3f270ee961d","resolution":{"observed_at":"2026-08-07T10:46:06.481712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.483866Z","title":"M., B a doiu, V.-A., Agache, A., Dumitru, M.-V., Vasilescu, I., Mantu, R., and Raiciu, C","venue":null,"work_id":"77745869-9b42-431c-8153-89eef04e2dc9","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.486456Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:af2d8bbd983348198c3547aca23ae9395beddbdf5aa658d56c4b2b095d689092","observation_id":"2d5fd34e-e590-48dd-950d-11b5d29c8612","resolution":{"observed_at":"2026-08-07T10:46:07.488168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T10:46:06.490714Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.490714Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9b4dd13f72ee520e199916097aa0b0eadff14efd829cbf2097625ff8b758836d","observation_id":"e6995cb0-cce3-45e5-98c2-1169e9dbcbe0","resolution":{"observed_at":"2026-08-07T10:46:06.490714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07852","last_updated":"2024-07-10T17:13:17Z","snapshot_observed_at":"2026-08-16T13:35:20.755259Z","submitted_at":"2024-07-10T17:13:17Z","title":"OpenDiLoCo: An Open-Source Framework for Globally Distributed Low-Communication Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07852","snapshot_observed_at":"2026-08-07T10:46:06.495371Z","title":"M., and Hagemann, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.495371Z"},"links":{"cited_paper":"/paper/2407.07852","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:3c968a60d7f28088f5abd41c5ebd65907f7cb842170e1e72d99dc19c02c9340b","observation_id":"3eb051e4-c1d3-4861-8b23-c97c2cf39f00","resolution":{"observed_at":"2026-08-07T10:46:06.495371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.469957Z","title":"MegaScale : Scaling large language model training to more than 10,000 gpus","venue":null,"work_id":"86b261b8-8fb1-42a8-b02b-f8ce5fb08a71","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.500093Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:6ea7a1625581a1850c14b11570f2adb0d8798a9e21a489c03bf46e36fa35496b","observation_id":"43874f70-0f92-41e3-b5b0-df147ae4cf6e","resolution":{"observed_at":"2026-08-07T10:46:07.474677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.455051Z","title":"Tighter theory for local sgd on identical and heterogeneous data","venue":null,"work_id":"4f1c3325-23b5-42bb-9a8d-e355cede5a21","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.505985Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:5a2ab2e6d489c3af04a2cb98cfe3f921bd026adb02f1498ba5c48ecbee113921","observation_id":"1a84a432-08b5-4fb5-be17-de251fa0e80f","resolution":{"observed_at":"2026-08-07T10:46:07.459720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.441552Z","title":"A unified theory of decentralized sgd with changing topology and local updates","venue":null,"work_id":"8e3d2705-426d-40eb-8dbb-6790397c3e01","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.510534Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:689515053c43ed90b617fd5f37d946f0d7aa7f102690a9f2cf1aac5ab72d4a69","observation_id":"53416eec-8621-40a5-ab27-02d4213d8aac","resolution":{"observed_at":"2026-08-07T10:46:07.445958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"0911.0491","last_updated":"2009-11-03T05:25:51Z","snapshot_observed_at":"2026-08-15T05:34:53.254382Z","submitted_at":"2009-11-03T05:25:51Z","title":"Slow Learners are Fast","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"0911.0491","snapshot_observed_at":"2026-08-07T10:46:06.514940Z","title":"Slow learners are fast","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.514940Z"},"links":{"cited_paper":"/paper/0911.0491","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:fbce48cefa2e9e1253c3b9fcb7d1c8a58b6feda7842257a81ad8fe2e85b3668b","observation_id":"26c6b3de-4ba5-4167-8a9d-527cc36910f3","resolution":{"observed_at":"2026-08-07T10:46:06.514940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.427196Z","title":"Amp: Automatically finding model parallel strategies with heterogeneity awareness","venue":null,"work_id":"f2e8606b-119a-41cc-82e5-a71d079df407","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.519385Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:65665e7b7d25e2ae8f83c92300153ea4e139d2a2d69bc0e92bc23df5cd213148","observation_id":"1b8d4b9e-3e89-4994-974a-f694be776ac0","resolution":{"observed_at":"2026-08-07T10:46:07.432174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.412490Z","title":"Fednar: Federated optimization with normalized annealing regularization","venue":null,"work_id":"4b8aa86e-15cd-41d3-a0d8-26d6bd8ef917","year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.523654Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:59f2b356d6131b5c2cdf3a1afad4107d913ee8c23eb1e3674457fb7cc958278d","observation_id":"3f21350b-6d89-4e14-80f5-df3d8bdeeb2b","resolution":{"observed_at":"2026-08-07T10:46:07.417124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.399323Z","title":"G., Park, J","venue":null,"work_id":"93001441-b14d-47c5-948a-2b0f95058a96","year":2014},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.527727Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:8b69bf1a04b7264565dc8f216773e5f6c9f892703e6a9d84e66aecd202783ee0","observation_id":"6bffd1a3-e126-4dcb-bd21-007970d65797","resolution":{"observed_at":"2026-08-07T10:46:07.403430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.531887Z","title":"K., Zaheer, M., Sanjabi, M., Talwalkar, A., and Smith, V","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.531887Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:531e02156e93d1b17c8ed4a27f4320a9a7ad004fd620581361d9bf33f1dadeb4","observation_id":"e7736bb6-3255-42e5-9752-152aeb9e5858","resolution":{"observed_at":"2026-08-07T10:46:06.531887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.377931Z","title":null,"venue":null,"work_id":"757861d7-b386-496e-bc6c-6cfdeeea84e8","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.536204Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:68d106f0fc41d8b5e5fa6cc013ef93bcd2b2c35e1bc9b19f547eebfa3ede96d3","observation_id":"3261fdbd-1c8c-41cb-a03c-dd1e27ebf29f","resolution":{"observed_at":"2026-08-07T10:46:07.382058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07217","last_updated":"2020-02-17T11:42:10Z","snapshot_observed_at":"2026-08-14T18:38:32.170609Z","submitted_at":"2018-08-22T04:50:55Z","title":"Don't Use Large Mini-Batches, Use Local SGD","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07217","snapshot_observed_at":"2026-08-07T10:46:06.540979Z","title":"U., Patel, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.540979Z"},"links":{"cited_paper":"/paper/1808.07217","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:3ac2383d4776a8e0da9921aff0ed15128a12407c978db9f555422b3b4a381cb5","observation_id":"02ff7cc4-9a31-4000-89e0-e1cd70153de6","resolution":{"observed_at":"2026-08-07T10:46:06.540979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09135","last_updated":"2024-09-23T10:49:33Z","snapshot_observed_at":"2026-08-16T14:26:49.611065Z","submitted_at":"2024-01-17T11:17:04Z","title":"Asynchronous Local-SGD Training for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09135","snapshot_observed_at":"2026-08-07T10:46:06.545546Z","title":"A., Shen, J., Szlam, A., and Ranzato, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.545546Z"},"links":{"cited_paper":"/paper/2401.09135","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:7acc34f1ba8e5a5d0bcc19d483406acc346130d944b5f786fa247706b755b730","observation_id":"44a85517-bbc4-4de7-9cac-fd334735de04","resolution":{"observed_at":"2026-08-07T10:46:06.545546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.364659Z","title":"An improved analysis of stochastic gradient descent with momentum","venue":null,"work_id":"1366d123-85ab-4454-9643-4cdec99a799b","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.549864Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:28974010af3b01d9853d24bb58bfe4474845fb95574734963cea91566c5d7e1c","observation_id":"35639ddb-bc58-40b0-8655-f200645a9705","resolution":{"observed_at":"2026-08-07T10:46:07.368999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T10:46:06.554007Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.554007Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:2261dd7dca5cc611e8177db5ea2cf4017da259f5e57b4676f7a3034507014b19","observation_id":"537bb3ed-9ee9-432f-a11c-abc5475b7593","resolution":{"observed_at":"2026-08-07T10:46:06.554007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.558982Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.558982Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:7744368e56098d8eafca712d5e18e7e6abaa0e54f0cb6a28f01c3a01d75e583b","observation_id":"b36412e9-5d56-4c00-a1cc-e0215694c667","resolution":{"observed_at":"2026-08-07T10:46:06.558982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01566","last_updated":"2025-03-05T20:00:57Z","snapshot_observed_at":"2026-08-16T13:46:36.936618Z","submitted_at":"2024-06-03T17:47:53Z","title":"Helix: Serving Large Language Models over Heterogeneous GPUs and Network via Max-Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01566","snapshot_observed_at":"2026-08-07T10:46:06.563160Z","title":"Helix: Distributed serving of large language models via max-flow on heterogeneous gpus","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.563160Z"},"links":{"cited_paper":"/paper/2406.01566","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:396bc78827d1a13bae8f887e0a325b705a5e14aff8f37982245702b2420a06d8","observation_id":"273bddff-6fb4-44da-a491-669bb0f35e2a","resolution":{"observed_at":"2026-08-07T10:46:06.563160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-08-12T13:00:33.339808Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-07T10:46:06.567529Z","title":"Mixed precision training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.567529Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:bf3c528cbe29ee7482af601017be81f63c31241fd6c72b59c820a76d5ff82cb6","observation_id":"79540e1c-29d9-4026-9a6a-a3c7909ab5ca","resolution":{"observed_at":"2026-08-07T10:46:06.567529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.340394Z","title":"and Ulukus, S","venue":null,"work_id":"d3a801cc-ce83-48c1-93b0-3d68c77a5d13","year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.571738Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:8db37759f950918d5180cbafe157f171b312766d9a91a4c9d862efb79e18347a","observation_id":"d2ec98a8-9bfd-44e3-8968-4096fd4687da","resolution":{"observed_at":"2026-08-07T10:46:07.345128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.327277Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"ce69db99-4596-4984-89a2-02d390900c6f","year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.575872Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:a4a9fa618f3bac99edf778bcb2673d40acb90b9afe070cd254ca62635d6ef96d","observation_id":"84bc9a37-a73c-41db-9144-c95d768817b3","resolution":{"observed_at":"2026-08-07T10:46:07.331632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.313918Z","title":"Federated learning with buffered asynchronous aggregation","venue":null,"work_id":"3faa43d7-3cad-439b-8af8-613a94707b59","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.579826Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:d08614f466b693337cf31aabeb6ce9eb6e377e4e0e9db200969a314110451db2","observation_id":"49d1d773-396d-4101-9f74-a60169bd6857","resolution":{"observed_at":"2026-08-07T10:46:07.318396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08133","last_updated":"2021-10-15T15:00:42Z","snapshot_observed_at":"2026-08-16T17:48:59.869707Z","submitted_at":"2021-10-15T15:00:42Z","title":"Trade-offs of Local SGD at Scale: An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08133","snapshot_observed_at":"2026-08-07T10:46:06.583881Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.583881Z"},"links":{"cited_paper":"/paper/2110.08133","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:0b01c0882a89f5131dc643b2a771379724ae6f5472efe7fca2e908dcfdbf0be9","observation_id":"2525ef75-a894-4941-8cea-9381966464f1","resolution":{"observed_at":"2026-08-07T10:46:06.583881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.300424Z","title":"Q., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fern \\'a ndez, R","venue":null,"work_id":"0c2481ad-b5bb-4050-bb4e-bd0e19aa079b","year":2016},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.587959Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:e45f90509e402a476ebcb0682c98b05a337b8aac4a93f290fa75d51d0767848a","observation_id":"afba612f-fdf6-4ea3-8656-6e2eafb7ea23","resolution":{"observed_at":"2026-08-07T10:46:07.304917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.286820Z","title":"Automatic mixed precision package - torch.amp","venue":null,"work_id":"69f4f522-7c18-4619-9728-e1e629660f32","year":2025},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.591966Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:f57d331a1c6094d90553cd40668490a28ceea4abbabe54b5ddab687606333629","observation_id":"6a58490a-c2da-4670-98af-7904d1a49ff1","resolution":{"observed_at":"2026-08-07T10:46:07.291281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.596049Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.596049Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:eb6dfd5696708a5fd807ace17be02e8237377ee25bfafc9bc71a2faee0092ff5","observation_id":"a2717fc3-ac89-4364-9715-7f3359dee362","resolution":{"observed_at":"2026-08-07T10:46:06.596049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09767","last_updated":"2019-05-03T12:58:04Z","snapshot_observed_at":"2026-08-14T19:11:29.708396Z","submitted_at":"2018-05-24T16:38:51Z","title":"Local SGD Converges Fast and Communicates Little","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09767","snapshot_observed_at":"2026-08-07T10:46:06.600071Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.600071Z"},"links":{"cited_paper":"/paper/1805.09767","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9baaaa0a3b964c2b0c12f1a6b4692bfbb9bb63150ccaf93b8764fce35df88eed","observation_id":"699cca50-5590-4211-bf8c-18eb009170d8","resolution":{"observed_at":"2026-08-07T10:46:06.600071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.264750Z","title":"Ml training with cloud gpu shortages: Is cross-region the answer? In Proceedings of the 4th Workshop on Machine Learning and Systems, pp.\\ 107--116, 2024","venue":null,"work_id":"15699845-09d9-42a8-a22a-148ff08718fc","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.604480Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:8ad019e5da0d81e4a138f8c9aaebea9dabedcafe9302d9b37b8bc3050b614ee8","observation_id":"88cfd329-67ed-4856-943e-98279e748666","resolution":{"observed_at":"2026-08-07T10:46:07.269324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16265","last_updated":"2024-01-29T16:12:31Z","snapshot_observed_at":"2026-08-17T10:41:35.640735Z","submitted_at":"2024-01-29T16:12:31Z","title":"CO2: Efficient Distributed Training with Full Communication-Computation Overlap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16265","snapshot_observed_at":"2026-08-07T10:46:06.608870Z","title":"Co2: Efficient distributed training with full communication-computation overlap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.608870Z"},"links":{"cited_paper":"/paper/2401.16265","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:74a2c651a104d4065b1a14e574926501d4cde91033d6984487124ceeba5ba4e0","observation_id":"95238f27-483a-4835-9220-b84b38a96561","resolution":{"observed_at":"2026-08-07T10:46:06.608870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.251730Z","title":"H., and Zhang, J","venue":null,"work_id":"3edf82e5-f121-4ec1-9e9e-d02868d543b2","year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.613266Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:670ac249a5a6af2804f128fcf06a1921734cf6a06289b5ec5705164e529769c5","observation_id":"a6656838-2a7a-4416-998a-f1a277d48c5e","resolution":{"observed_at":"2026-08-07T10:46:07.255841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.238653Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":"7638ab39-1852-4ff2-bd94-46c310a0c324","year":2013},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.617316Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:e86ec9d8dede8c840fcf3c7335c930953699ff63f6609493ee52ebf22a644fd5","observation_id":"6189058a-67ed-433a-a0d6-478ce4200ebc","resolution":{"observed_at":"2026-08-07T10:46:07.243135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12707","last_updated":"2024-10-16T16:13:19Z","snapshot_observed_at":"2026-08-17T13:00:53.411450Z","submitted_at":"2024-10-16T16:13:19Z","title":"FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12707","snapshot_observed_at":"2026-08-07T10:46:06.621574Z","title":"Fusionllm: A decentralized llm training system on geo-distributed gpus with adaptive compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.621574Z"},"links":{"cited_paper":"/paper/2410.12707","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:8de5e40035c89beb4e7405f811e993a982e1b0961c4fb522e2846fadd08f72c2","observation_id":"6ccdea98-c0bf-4551-ad60-9bbd5aeea7c6","resolution":{"observed_at":"2026-08-07T10:46:06.621574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.223923Z","title":"Optimization of collective communication operations in mpich","venue":null,"work_id":"89b558ec-6f82-4eaa-be0b-1512350ebadf","year":2005},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.626213Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:306590ac59c17d6225176a6f726293d6f31521be4f874ab7248212923f9fead5","observation_id":"c22ac7c7-f870-4664-a531-3e146bf76c3f","resolution":{"observed_at":"2026-08-07T10:46:07.229093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.209056Z","title":null,"venue":null,"work_id":"fbea90e7-cc00-4e4c-a724-a3c867566df1","year":1990},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.630309Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:c02d4ad5de3476752c8928c5b712b6db0e3f5a1c025bcd64f56e3942b47beb8f","observation_id":"24384d89-4a6b-40bc-aa21-14b8d738190d","resolution":{"observed_at":"2026-08-07T10:46:07.214357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.194044Z","title":"and Joshi, G","venue":null,"work_id":"86e8fd08-4285-48f8-86f2-9c9a60fe52f6","year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.634425Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:eaf381c7d2774b777d5275b6ce883d487f42fc514701b6ec6830da12c8511cb3","observation_id":"737e0187-f050-438d-a86b-f7fd9d35a8e6","resolution":{"observed_at":"2026-08-07T10:46:07.198660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00643","last_updated":"2020-02-19T20:00:02Z","snapshot_observed_at":"2026-08-11T15:09:30.727773Z","submitted_at":"2019-10-01T20:06:48Z","title":"SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00643","snapshot_observed_at":"2026-08-07T10:46:06.638357Z","title":"Slowmo: Improving communication-efficient distributed sgd with slow momentum","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.638357Z"},"links":{"cited_paper":"/paper/1910.00643","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:4993274c683b1e70a425d29eab12a9b6b74d7764fb8e68a79dc59c63a74538dc","observation_id":"c79c6f55-67ad-49b6-9528-6e98935ee3bf","resolution":{"observed_at":"2026-08-07T10:46:06.638357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.179352Z","title":null,"venue":null,"work_id":"f30f9080-10d8-443d-93eb-90b3e3c1ef61","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.642753Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:e3a70d4c7057810e50538f9a692ecc4432bfc9ac46a2a0c6dc2177dbbd905e79","observation_id":"bf7e4ae6-c427-4c87-8d7c-af088e0b397e","resolution":{"observed_at":"2026-08-07T10:46:07.184384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00054","last_updated":"2022-05-31T18:42:29Z","snapshot_observed_at":"2026-08-16T16:56:12.945962Z","submitted_at":"2022-05-31T18:42:29Z","title":"Asynchronous Hierarchical Federated Learning","version":1},"cited_work":{"arxiv_id":"2206.00054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00054","snapshot_observed_at":"2026-08-07T10:46:06.779803Z","title":"Asynchronous Hierarchical Federated Learning","venue":"cs.LG","work_id":"2174e31e-794e-4c12-a027-6d0f7177b1c1","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.646548Z"},"links":{"cited_paper":"/paper/2206.00054","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:3ef78c380ad1aeb9d79e278d5db775f59f913e467f5d790e25ad4b01ecd7fbaa","observation_id":"59b52d04-4e0f-4d3d-8a33-4274223034e0","resolution":{"observed_at":"2026-08-07T10:46:06.784740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.650844Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.650844Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:ec2c4ba1c961a8311188045abe189b6ac45ba1ba81a01c297c68fc2202e5967d","observation_id":"2f18f26b-a863-4fdb-9cf0-fe13ed98c8f8","resolution":{"observed_at":"2026-08-07T10:46:06.650844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03934","last_updated":"2020-12-05T01:33:57Z","snapshot_observed_at":"2026-08-14T17:04:44.463504Z","submitted_at":"2019-03-10T06:19:38Z","title":"Asynchronous Federated Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03934","snapshot_observed_at":"2026-08-07T10:46:06.655253Z","title":"Asynchronous federated optimization","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.655253Z"},"links":{"cited_paper":"/paper/1903.03934","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:ef216254d1cb40b44d2094cac6ca2a794702d145ee1ce53874c8d10dc8ec35bb","observation_id":"1ad8ad91-94f0-43e9-802b-acff48e72d75","resolution":{"observed_at":"2026-08-07T10:46:06.655253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.165547Z","title":"Hierarchical global asynchronous federated learning across multi-center","venue":null,"work_id":"b7f7b8e1-4465-4072-a57c-417e67f09ff9","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.659681Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:456b320800719c8e4fdf20498e39cf7c74257c3c292eb6fe43f23f3900f3e156","observation_id":"a8e3185b-aaa5-463f-8da3-8abff6b47b04","resolution":{"observed_at":"2026-08-07T10:46:07.169945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T10:46:06.663683Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.663683Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:7d897b192229a4195c16d9170aaf4e6598ae48a74d21ee953709133a54d8eb4e","observation_id":"b7610af2-5f14-43a9-ae0e-398ceb3d562f","resolution":{"observed_at":"2026-08-07T10:46:06.663683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.151953Z","title":"Parallel restarted sgd with faster convergence and less communication: Demystifying why model averaging works for deep learning","venue":null,"work_id":"2904a4e3-ca7d-41fc-9fff-604e0976cc32","year":2019},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.668243Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:4bedca1aa2b65bf2c5553ca8855e9951dd4112011f51f22c009e8ce128e8a36f","observation_id":"51191fdb-9d3e-460c-99eb-0685035090ab","resolution":{"observed_at":"2026-08-07T10:46:07.156426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.138770Z","title":"S., Re, C., and Zhang, C","venue":null,"work_id":"4d88781b-51f8-45df-a36e-7fddce6581d2","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.672356Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:edbb5256880bea865676288bc1eef980ebd31093482f66941d603bab398d9a9b","observation_id":"d57a8550-0e7a-48d4-85a1-fdb19a209639","resolution":{"observed_at":"2026-08-07T10:46:07.143017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.676676Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.676676Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:03f505f8e43e7ff2c34bba0cd04fb113e3e811e8869ca1c4e897a5ce3bfb55ff","observation_id":"dd7386b0-8461-44c1-9b2e-23a322d8f8aa","resolution":{"observed_at":"2026-08-07T10:46:06.676676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.116037Z","title":"E., and LeCun, Y","venue":null,"work_id":"672d37b1-37d2-49dc-b05b-e218b86a73c0","year":2015},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.681158Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:436ce09230d93662930a3fd6385abedd3bad3b41fd7d5b8663d48be8d63e701b","observation_id":"f73681d9-649b-4e63-b675-484757c415c5","resolution":{"observed_at":"2026-08-07T10:46:07.120749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01439","last_updated":"2024-06-20T12:04:28Z","snapshot_observed_at":"2026-08-16T13:46:40.733377Z","submitted_at":"2024-06-03T15:29:46Z","title":"Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients","version":2},"cited_work":{"arxiv_id":"2406.01439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01439","snapshot_observed_at":"2026-08-07T10:46:06.730996Z","title":"Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients","venue":"cs.LG","work_id":"41cfa36a-41c2-4c06-862a-d8dd1e0c0519","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.685339Z"},"links":{"cited_paper":"/paper/2406.01439","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9b77ade600224752c3e3310d93b9c21b67c76ae36d855c49962262f08b9e9f2a","observation_id":"549790fa-ed03-41d3-b02c-60da6f815395","resolution":{"observed_at":"2026-08-07T10:46:06.737552Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T21:34:23.713830Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.04531."}