{"as_of":"2026-08-16T23:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ff7fb459d07f27698b176e479922635dbd34ac862e1cb01ec96d0690a758700","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:20:04.267992Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T12:16:10.904456Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:07:37.154141Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2507.06542","last_updated":"2026-04-27T10:34:05Z","snapshot_observed_at":"2026-08-11T04:34:49.334846Z","submitted_at":"2025-07-09T04:56:56Z","title":"On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T05:39:53.088948Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2507.06542"},"observation_digest":"sha256:997b509259d8b476dfcd82f496d2c0abe3bf659861dc16d96eb7a24eb71e5fa7","observation_id":"9f4ddb48-f020-4438-8ec9-11deb9df7c3c","resolution":{"observed_at":"2026-05-19T05:42:06.077358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2604.21428","last_updated":"2026-04-23T08:45:38Z","snapshot_observed_at":"2026-08-15T06:43:26.232677Z","submitted_at":"2026-04-23T08:45:38Z","title":"Decoupled DiLoCo for Resilient Distributed Pre-training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T22:20:21.090246Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2604.21428"},"observation_digest":"sha256:0c0673255921e76f4717a8a4662033d4f4b1957e9e96e722f0b60bcc339d23f1","observation_id":"d5a3b6dc-44df-48ab-b0e6-d5b776525c35","resolution":{"observed_at":"2026-05-09T22:49:15.635560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2606.00271","last_updated":"2026-05-29T19:02:10Z","snapshot_observed_at":"2026-08-06T23:05:44.963983Z","submitted_at":"2026-05-29T19:02:10Z","title":"HeLoCo: Efficient asynchronous low-communication training under data and device heterogeneity","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T20:45:29.941331Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2606.00271"},"observation_digest":"sha256:7a5807a6cd68a8f5d6bef3afd0a7a683020f47fc4eeaaf39a318db9a50e4b9b8","observation_id":"1369cf40-bbcb-47e1-8b3d-2acc0ba81afd","resolution":{"observed_at":"2026-06-28T20:52:37.872136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2606.11081","last_updated":"2026-06-09T16:40:54Z","snapshot_observed_at":"2026-08-03T08:40:34.396170Z","submitted_at":"2026-06-09T16:40:54Z","title":"Unifying Local Communications and Local Updates for LLM Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T14:07:42.062805Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2606.11081"},"observation_digest":"sha256:e4afe36009c5b7a6879a996dc69bc2c5666f87d73d6885db1ab89189f0ad5ae3","observation_id":"4ee2c74a-bab3-43c8-8200-9d4ed470519e","resolution":{"observed_at":"2026-07-03T04:07:37.155683Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-12T12:16:10.904456Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02544","last_updated":"2026-06-24T05:57:19Z","snapshot_observed_at":"2026-08-09T02:27:02.251729Z","submitted_at":"2026-06-24T05:57:19Z","title":"Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-12T12:16:10.904456Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2607.02544"},"observation_digest":"sha256:733e0714799dc4edb0fd914abe48828d2a1f2b5b14f5fc452866343d897e1e82","observation_id":"20fcc947-712b-4d19-80f8-a8be10b42200","resolution":{"observed_at":"2026-07-12T12:16:10.904456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10911/citation-record","integrity":"/paper/2506.10911/integrity","json":"/paper/2506.10911/citation-record.json","paper":"/paper/2506.10911"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:04.963450Z","title":null,"venue":null,"work_id":"5f73a40d-2bdc-4e72-9852-09a216839fd2","year":2013},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:04.267992Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:e9436454723f0e1f870fb3d43fbeb250240d94550c31098eb781107d44e80fa6","observation_id":"17186e22-de31-4b7b-80cc-87472de0c03a","resolution":{"observed_at":"2026-08-07T04:20:05.026257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09799","last_updated":"2025-03-12T20:04:38Z","snapshot_observed_at":"2026-08-16T12:50:36.174155Z","submitted_at":"2025-03-12T20:04:38Z","title":"Communication-Efficient Language Model Training Scales Reliably and Robustly: Scaling Laws for DiLoCo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09799","snapshot_observed_at":"2026-08-07T04:20:01.105792Z","title":"Communication-efficient language model training scales reliably and robustly: Scaling laws for diloco.arXiv preprint arXiv:2503.09799,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.105792Z"},"links":{"cited_paper":"/paper/2503.09799","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:6f4885359be8e2ad61dcc39c170b14e3ff2be0bc1c4062b5af73194e05ebfeb0","observation_id":"b44aafe4-29b1-4f1c-b8fb-76420366909f","resolution":{"observed_at":"2026-08-07T04:20:01.105792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20018","last_updated":"2024-07-29T13:53:27Z","snapshot_observed_at":"2026-08-16T13:30:12.966672Z","submitted_at":"2024-07-29T13:53:27Z","title":"Efficient Training of Large Language Models on Distributed Infrastructures: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20018","snapshot_observed_at":"2026-08-07T04:20:01.632451Z","title":"Efficient training of large language models on distributed infrastructures: a survey.arXiv preprint arXiv:2407.20018,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.632451Z"},"links":{"cited_paper":"/paper/2407.20018","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:d3b5e7d6f01388fa6d69d2b8520da840c052e3a38968fcffc0577e5a44f8a99e","observation_id":"dc4ae879-c1d3-40eb-9951-968107914fb6","resolution":{"observed_at":"2026-08-07T04:20:01.632451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06465","last_updated":"2024-11-10T13:45:08Z","snapshot_observed_at":"2026-08-16T23:34:52.924098Z","submitted_at":"2024-11-10T13:45:08Z","title":"Accelerating Large Language Model Training with 4D Parallelism and Memory Consumption Estimator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06465","snapshot_observed_at":"2026-08-07T04:20:01.748761Z","title":"Accelerating large language model training with 4d parallelism and memory consumption estimator.arXiv preprint arXiv:2411.06465,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.748761Z"},"links":{"cited_paper":"/paper/2411.06465","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:8fe2a440d65ead0932cc12c85a5468bc90ba046ffd2520c0543cbb3a62f3cec3","observation_id":"6d204c69-99c5-4a21-bd5b-525ec5c9bf7f","resolution":{"observed_at":"2026-08-07T04:20:01.748761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:05.425659Z","title":"Multi-modal retrieval for large language model based speech recognition","venue":null,"work_id":"ebb63fc5-2d95-4852-a92d-952446316d2b","year":2024},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.864939Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:1b1196c4b1299a5c0befcbcd8a88af2cff0d92d3a29ecc47ec2c74f6f14dc228","observation_id":"3e815e8f-b7d8-4f4f-a5e3-437ea48638f0","resolution":{"observed_at":"2026-08-07T04:20:05.518206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:20:01.974493Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.974493Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:31a444930d376ec6e767cc80d52d43b1b4d49694b7fa9fc176615257e476ec7f","observation_id":"b01983a9-bd29-40e3-9935-155b55572131","resolution":{"observed_at":"2026-08-07T04:20:01.974493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:05.272664Z","title":"Gossip learning as a decentralized alternative to federated learning","venue":null,"work_id":"f807a31a-9f60-434e-82ce-7223ae963b20","year":2019},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.148062Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:212151cb860eda2a4d1725f7be0f4956892b98024b01dcbac34948d70feb8a26","observation_id":"77259df9-ea19-4f21-ac1c-ae6023676458","resolution":{"observed_at":"2026-08-07T04:20:05.355092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01152","last_updated":"2024-12-02T05:52:32Z","snapshot_observed_at":"2026-08-16T04:43:09.667320Z","submitted_at":"2024-12-02T05:52:32Z","title":"INTELLECT-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01152","snapshot_observed_at":"2026-08-07T04:20:02.210179Z","title":"Intellect-1 technical report.arXiv preprint arXiv:2412.01152,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.210179Z"},"links":{"cited_paper":"/paper/2412.01152","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:580b41317434fa6698b09878321efa72a0b497402153eb10afe1c5a5d32f6381","observation_id":"3374d221-5816-47ef-83dd-ecb16684645c","resolution":{"observed_at":"2026-08-07T04:20:02.210179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12996","last_updated":"2025-02-18T16:16:14Z","snapshot_observed_at":"2026-08-16T12:57:16.056433Z","submitted_at":"2025-02-18T16:16:14Z","title":"Eager Updates For Overlapped Communication and Computation in DiLoCo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12996","snapshot_observed_at":"2026-08-07T04:20:02.348645Z","title":"Eager updates for overlapped communication and computa- tion in diloco.arXiv preprint arXiv:2502.12996,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.348645Z"},"links":{"cited_paper":"/paper/2502.12996","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:b686e2c79ef4553c5b841a4bb356a7d27655f3431b530eb9ee45f4442bc0665b","observation_id":"3c9ed00b-a904-4091-89e0-3e9c0ab20b07","resolution":{"observed_at":"2026-08-07T04:20:02.348645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-08-16T16:40:53.472876Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T04:20:02.441768Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models.arXiv preprint arXiv:2208.03306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.441768Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:f620c7f7073d03d2b7a4c2a532484855ae2405ce6e58e823d0e8320bfbe9bb73","observation_id":"b4b1e656-90ed-4aec-8020-cb5f269abe2c","resolution":{"observed_at":"2026-08-07T04:20:02.441768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T04:20:02.634075Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.634075Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:63533b85d6bd91369101cc0288751002ffea15e5acb0db95cedab8f21c7b8cf4","observation_id":"10e37934-bee7-490a-a7d6-0280c0aea2cc","resolution":{"observed_at":"2026-08-07T04:20:02.634075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T04:20:02.772956Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.772956Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:832fad1c5a727301d5e7304787af3ee1e654257b20d006bd4ffb9e1474863c26","observation_id":"530c52cb-cc8e-42ee-8693-b14682ecb157","resolution":{"observed_at":"2026-08-07T04:20:02.772956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:05.078727Z","title":"Voxtlm: Unified decoder-only models for consolidating speech recognition, synthesis and speech, text continuation tasks","venue":null,"work_id":"90f95a3c-2814-48ca-a589-ffc3600926e2","year":2024},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.891618Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:0d6400186b37f5d7a07b4bea7419b67893e55f6c253a98fe13e8f09c93fdca53","observation_id":"a4cc0a39-b71e-4342-829e-77b1049da533","resolution":{"observed_at":"2026-08-07T04:20:05.196952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:02.977721Z","title":"Decoupled momentum optimization.arXiv preprint arXiv:2411.19870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.977721Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:176d8b182d0104db9e5ae41207f9bb281fd5bb7b825a592fa3a6c1132e42c88e","observation_id":"aa96d7c7-d788-4ba7-87a7-e7b9fa5ab439","resolution":{"observed_at":"2026-08-07T04:20:02.977721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-07T04:20:03.098045Z","title":"Audiopalm: A large language model that can speak and listen.arXiv preprint arXiv:2306.12925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.098045Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:5881b4d465b050d5d1db79d0c5912a1a27a0919ab03401a18dd635afd1efad84","observation_id":"95c78d5c-61c1-4da5-ab96-fd94ef911029","resolution":{"observed_at":"2026-08-07T04:20:03.098045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03488","last_updated":"2024-11-11T01:33:50Z","snapshot_observed_at":"2026-08-16T13:45:47.261424Z","submitted_at":"2024-06-05T17:50:03Z","title":"Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03488","snapshot_observed_at":"2026-08-07T04:20:03.399755Z","title":"Seq1f1b: Efficient sequence-level pipeline parallelism for large language model training.arXiv preprint arXiv:2406.03488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.399755Z"},"links":{"cited_paper":"/paper/2406.03488","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:114524326e81ccf5ce6f7ee0eacbc28d4f6b55c36f3db753774ce7c038347bd5","observation_id":"32e693ef-cd80-4b41-b600-8517c3f41108","resolution":{"observed_at":"2026-08-07T04:20:03.399755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:20:03.463865Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.463865Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:9f5d303ad3a088800e16353ec3f1917a9c1420e56b795593f71f46278a271e08","observation_id":"cd3950f5-67fb-440c-b0d9-34d6f7f6243a","resolution":{"observed_at":"2026-08-07T04:20:03.463865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:20:03.596714Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.596714Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:1fd2426f654d41bd2b93784d06aadff2ad03430c9dd57351a368a1c3963a0c4d","observation_id":"7bd30d2f-f0d0-4fb0-8a71-1d82af263cdc","resolution":{"observed_at":"2026-08-07T04:20:03.596714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02021","last_updated":"2018-03-06T05:01:37Z","snapshot_observed_at":"2026-08-14T19:39:12.132907Z","submitted_at":"2018-03-06T05:01:37Z","title":"Understanding Short-Horizon Bias in Stochastic Meta-Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02021","snapshot_observed_at":"2026-08-07T04:20:03.712956Z","title":"Understanding short-horizon bias in stochastic meta- optimization.arXiv preprint arXiv:1803.02021,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.712956Z"},"links":{"cited_paper":"/paper/1803.02021","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:213daa20f6e5a365128d0f16d575701a518d040c12730caf4ddbb12ba0f04ac4","observation_id":"acc50d72-f732-4238-9b91-c6dec2b411bf","resolution":{"observed_at":"2026-08-07T04:20:03.712956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T04:20:03.894658Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.894658Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:2755567429f07730af2ba6d492f6371e4ce29e86135fcf484f03de3060a130b2","observation_id":"220f8bba-cf8e-446a-b0d3-556a1f5f6b26","resolution":{"observed_at":"2026-08-07T04:20:03.894658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T04:20:04.008649Z","title":"Opt: Open pre-trained transformer language models.arXiv preprint arXiv:2205.01068,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:04.008649Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:18be2528fcd4ce85a2baa7773e33e5bf48fd1737d153d203d95dbe14003fb497","observation_id":"690eda80-e49a-436d-882c-c9a5acbceded","resolution":{"observed_at":"2026-08-07T04:20:04.008649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T04:20:04.131435Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:04.131435Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:734bd06d46845aa265e125c5665f69b52c4e45efbb11404dd19f681c2b00f1f7","observation_id":"f07824be-df69-48a6-93ae-a5650d60d4c5","resolution":{"observed_at":"2026-08-07T04:20:04.131435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T04:20:03.212684Z","title":"Megatron- lm: Training multi-billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.212684Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:14471523b37573e405ffc5e64f94da01b160b95d1c8ff2e658e5eaeb33f1f834","observation_id":"53121814-be8b-4886-b40d-58a300d2c5a5","resolution":{"observed_at":"2026-08-07T04:20:03.212684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T04:20:03.825593Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.825593Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:5b165033a60d9f06cb7bdd9824cb4de960b86da9dfddcf19eff43eb44f680db2","observation_id":"98f1ddbe-3a72-4627-8ce1-11e6c3bbf1d3","resolution":{"observed_at":"2026-08-07T04:20:03.825593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04093","last_updated":"2025-02-09T16:06:53Z","snapshot_observed_at":"2026-08-16T13:27:50.806670Z","submitted_at":"2024-08-07T21:16:55Z","title":"Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04093","snapshot_observed_at":"2026-08-07T04:20:03.307804Z","title":"Tree attention: Topology-aware decoding for long-context attention on gpu clusters.arXiv preprint arXiv:2408.04093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.307804Z"},"links":{"cited_paper":"/paper/2408.04093","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:ab5532dd8578991808d96ee4daf4146781c1e949362859b53acbbe5d2518ca84","observation_id":"447711e1-fe9b-42e6-9541-dab3815cd531","resolution":{"observed_at":"2026-08-07T04:20:03.307804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12918","last_updated":"2025-02-03T18:24:33Z","snapshot_observed_at":"2026-08-16T13:08:42.033891Z","submitted_at":"2024-10-16T18:03:52Z","title":"Boosting Asynchronous Decentralized Learning with Model Fragmentation","version":2},"cited_work":{"arxiv_id":"2410.12918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12918","snapshot_observed_at":"2026-08-07T04:20:04.785312Z","title":"Boosting Asynchronous Decentralized Learning with Model Fragmentation","venue":"cs.DC","work_id":"1d0344da-8895-4c80-9f0e-c6cd44149f7a","year":2024},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:00.935672Z"},"links":{"cited_paper":"/paper/2410.12918","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:437484e6260e1e13a01f521743b3c7c0c01404999b1a9df17fd111b4fffa475e","observation_id":"55ee83f6-9f03-4f0c-a4d7-a8b5b4219cc9","resolution":{"observed_at":"2026-08-07T04:20:04.862629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-16T14:43:27.914181Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T04:20:01.338312Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.338312Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:a43f2ca9ccb1eca02551d4388aa3d4134f8f5447e36e8daf445b6ebf78b6523a","observation_id":"407c224f-5d82-43e0-9a22-a0ba775b36cf","resolution":{"observed_at":"2026-08-07T04:20:01.338312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T04:20:02.518775Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.518775Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:cbf59212b0e74f74f9601513e525386bf29e577abc6a51d6f4e7f6c69e326b71","observation_id":"1faccbb5-2426-49f5-9ba6-a16d4417fef3","resolution":{"observed_at":"2026-08-07T04:20:02.518775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10616","last_updated":"2024-03-15T18:26:51Z","snapshot_observed_at":"2026-08-16T14:09:21.078028Z","submitted_at":"2024-03-15T18:26:51Z","title":"DiPaCo: Distributed Path Composition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10616","snapshot_observed_at":"2026-08-07T04:20:01.483869Z","title":"Dipaco: Distributed path composition.arXiv preprint arXiv:2403.10616,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.483869Z"},"links":{"cited_paper":"/paper/2403.10616","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:b90f50cb446e3e5db2bbdfbc6729997fb98af4fe84de1e120156bfaadf5869af","observation_id":"4d229f63-2d0b-43a6-bd9c-1b00d23b3a15","resolution":{"observed_at":"2026-08-07T04:20:01.483869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-16T13:39:21.916392Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T04:20:01.009446Z","title":"A survey on mixture of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.009446Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:402e7563b91a7a13ce955394e47310eae04d276aa16b1482ac811de3ef82fa1b","observation_id":"280f9081-1285-4bea-b77f-4aa7a991a3ec","resolution":{"observed_at":"2026-08-07T04:20:01.009446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-16T18:30:48.108993Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-07T04:20:01.226611Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.226611Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:0270394ba2a937598f201163187b139f46eaae2eb447927a172255878f6b1eac","observation_id":"a13ce9fc-8aa6-4add-9d92-7032a549a2ea","resolution":{"observed_at":"2026-08-07T04:20:01.226611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T21:29:33.396055Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 5 inbound Pith citation observations for arXiv:2506.10911."}