{"as_of":"2026-08-23T02:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:622dfb2586f7c6e21d4b6c3932b6852c79c1c904cd90895a0e3cea9935fc1d99","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:42:38.233849Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.04266/citation-record","integrity":"/paper/2501.04266/integrity","json":"/paper/2501.04266/citation-record.json","paper":"/paper/2501.04266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.661881Z","title":"Introducing the next generation of Claude — anthropic.com,","venue":null,"work_id":"b0471487-d5c4-4771-9c79-6c271df29f5b","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.092503Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:b520daaf51193638e0863eec38e67ba33ee7fcdf13058e2a022d04d48f656fab","observation_id":"556f303e-7734-4b11-b9d8-2844dd8417d2","resolution":{"observed_at":"2026-08-10T21:42:38.665918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T21:42:38.097420Z","title":"Gemma: Open models based on gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.097420Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:3eb887377f93b26127cd066c7f45549abb8c0452b004925d5aa2e35cca55037b","observation_id":"d4e413ca-aabc-45e0-92b2-55fb4cbdfb9e","resolution":{"observed_at":"2026-08-10T21:42:38.097420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.102113Z","title":"Llama 3 model card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.102113Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:498aba5b623e70e9819e1a9fb781319acf9ca350cca336e6ea7225823d4bd8a6","observation_id":"b15f156a-3aac-4470-a570-fb3a0d78245b","resolution":{"observed_at":"2026-08-10T21:42:38.102113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T21:42:38.106390Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.106390Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:a319722afddd12f3d93b0b6a9ed94a942bd7fe5e2f4403b6751a5d0770a7c9f4","observation_id":"9dbe729f-675d-4788-ba68-023caeb7369a","resolution":{"observed_at":"2026-08-10T21:42:38.106390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T21:42:38.110991Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.110991Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:2e260691039eab1babc0e73ea661b0460101cb974b827bbdaa3712c249f10d55","observation_id":"0d7b9409-785c-44b4-912a-902f96bb8725","resolution":{"observed_at":"2026-08-10T21:42:38.110991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.115345Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.115345Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:55de6f5c6379fb956e5a0ac9857260eb6096263444e2413f396d569d840e0c2c","observation_id":"3b8c2180-fd1c-459e-9437-ea320f8ebbd7","resolution":{"observed_at":"2026-08-10T21:42:38.115345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-10T21:42:38.123613Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.123613Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:cba9e78e62383fe9800cb99f9bda5d53e4d23a3cc748eefe1b29b401ea8876aa","observation_id":"bcbdff8a-f26d-4bc1-b441-fb0214fe0104","resolution":{"observed_at":"2026-08-10T21:42:38.123613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.636104Z","title":"The mvapich project: Transforming research into high-performance mpi library for hpc community,","venue":null,"work_id":"ef8aa22f-0421-4f0c-bf7a-7cdf2ca9f360","year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.127811Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:16e6b85fea94eb74958b75a0e0fc068d162cae8ad2b7bd1310e748f33c67a261","observation_id":"b3fe7a0d-a675-4545-a842-7d5c137f3e71","resolution":{"observed_at":"2026-08-10T21:42:38.640073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.623174Z","title":"Scalable Distributed DNN Training using TensorFlow and CUDA-Aware MPI: Characterization, Designs, and Performance Evaluation,","venue":null,"work_id":"490f3eb9-e840-49cf-bf05-cdb69ee4eaf2","year":2019},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.132220Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:5b99deafd62bcb0b71ee5b8366bbd81adeb029e98535001ccdca4666cf960ec5","observation_id":"064a4e3b-3562-49de-9495-bfe45d86a64f","resolution":{"observed_at":"2026-08-10T21:42:38.627707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.610923Z","title":"NVIDIA Collective Communications Library (NCCL),","venue":null,"work_id":"c132b5bf-2126-4d1e-b1c4-04b2a64c5524","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.135902Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:fbec0c96c15886916fff80b12fb36fa81775980bfe80f76c66c453c09393c74b","observation_id":"954b19cf-6e28-4fac-b409-9ff30e210e7b","resolution":{"observed_at":"2026-08-10T21:42:38.614921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00257","last_updated":"2024-03-13T14:28:03Z","snapshot_observed_at":"2026-08-19T19:46:00.848745Z","submitted_at":"2023-11-01T03:14:48Z","title":"AMSP: Reducing Communication Overhead of ZeRO for Efficient LLM Training","version":2},"cited_work":{"arxiv_id":"2311.00257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00257","snapshot_observed_at":"2026-08-10T21:42:38.395210Z","title":"AMSP: Reducing Communication Overhead of ZeRO for Efficient LLM Training","venue":"cs.DC","work_id":"442f5533-0b91-491a-acfd-28827515222d","year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.139962Z"},"links":{"cited_paper":"/paper/2311.00257","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:d19ec75960bcbf7d7ef39e118074932472b99a869e8a01074f825bf47951c020","observation_id":"02bcaf6a-9e55-4078-a489-a98d61c9662c","resolution":{"observed_at":"2026-08-10T21:42:38.400265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-10T21:42:38.144213Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.144213Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:f8308e0bcd60969ec6cf04715cabc2c1ab050139ed868961e633e4d4f1427638","observation_id":"3da99280-6328-4b4c-a270-735321a48d59","resolution":{"observed_at":"2026-08-10T21:42:38.144213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.591074Z","title":"Fairscale: A general purpose modular pytorch li- brary for high performance and large scale training,","venue":null,"work_id":"99033d6c-3b28-4fed-b659-ae69a047d646","year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.157012Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:30ba250d4ce832a0a5d0626583217f3f676add9ea48956baf1ab86f84797b93e","observation_id":"a9c65893-895e-43d9-84ff-ba1a9ebdca58","resolution":{"observed_at":"2026-08-10T21:42:38.595578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.579121Z","title":"Megatron-LM: Ongoing research training transformer models at scale,","venue":null,"work_id":"b3997667-ec64-4f11-a7f9-c08b6a7fa0b7","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.160347Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:4376bd993b5f3f7759c278592959190cb2da054bcd9931d6aa0335fc585acc16","observation_id":"7d60d192-106f-499a-bdca-3fb29ecc7704","resolution":{"observed_at":"2026-08-10T21:42:38.583069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.566946Z","title":"Frontier - HPE Cray EX235a, AMD Optimized 3rd Generation EPYC 64C 2GHz, AMD Instinct MI250X, Slingshot-11 | TOP500 — top500.org,","venue":null,"work_id":"520c94c3-69b3-48a4-9864-d05fdddcb738","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.164101Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:e406d9e5578c03a1d370b3cd7da84318a96dfe321a75a2195c4ca7ec012521e2","observation_id":"29ad6087-e169-4d2c-85c3-f1d09dcbbedc","resolution":{"observed_at":"2026-08-10T21:42:38.571146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.554237Z","title":"An in-depth analysis of the slingshot interconnect,","venue":null,"work_id":"b1606bfb-d122-4070-ad7f-cf6416f215ce","year":2020},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.167716Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:7f0bd5043ca3d42852f1ce97ae90184100c879f5518eb8d86069cc02fb549433","observation_id":"f524f000-a4fe-4496-a184-36f228f07747","resolution":{"observed_at":"2026-08-10T21:42:38.558817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10209","last_updated":"2023-06-16T23:26:19Z","snapshot_observed_at":"2026-08-21T10:00:49.700416Z","submitted_at":"2023-06-16T23:26:19Z","title":"ZeRO++: Extremely Efficient Collective Communication for Giant Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10209","snapshot_observed_at":"2026-08-10T21:42:38.171907Z","title":"Zero++: Extremely efficient collective communication for giant model training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.171907Z"},"links":{"cited_paper":"/paper/2306.10209","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:d9d19b8ec2638e16f19f828ceb7df48a3938eff4a9107c40d3fc6bf45a974de0","observation_id":"e6cee94d-9069-47d4-9335-4375fccf66f0","resolution":{"observed_at":"2026-08-10T21:42:38.171907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09941","last_updated":"2018-09-15T08:36:28Z","snapshot_observed_at":"2026-08-18T16:12:45.242664Z","submitted_at":"2018-02-26T08:47:34Z","title":"Demystifying Parallel and Distributed Deep Learning: An In-Depth Concurrency Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09941","snapshot_observed_at":"2026-08-10T21:42:38.175813Z","title":"Demystifying parallel and distributed deep learning: An in-depth concurrency analysis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.175813Z"},"links":{"cited_paper":"/paper/1802.09941","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:dd27fcff12ca32b5b3114e880fd7584ad9463c9f7e3e619d4fe93677e8bde85f","observation_id":"18d3800b-6188-415e-b7f8-9f91ee29305c","resolution":{"observed_at":"2026-08-10T21:42:38.175813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.541533Z","title":"Scaling single- image super-resolution training on modern hpc clusters: Early experi- ences,","venue":null,"work_id":"0abe7406-6f77-41d6-94f3-ba33ab05310d","year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.179854Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:5b8d0b412f25e37ddb02c36529825add32f9b765d9d1a595bb01a3b2599b3ac6","observation_id":"9b89cf4b-5e8f-44d7-9ef6-76c09e6094e6","resolution":{"observed_at":"2026-08-10T21:42:38.545770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.183548Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.183548Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:39109f71b93aaceda8d1164d06b8d78aac20d50f7978b05e1761f2c85aef670c","observation_id":"660dbb0d-91ae-41fb-bdd4-68fbb0370391","resolution":{"observed_at":"2026-08-10T21:42:38.183548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-08-18T09:55:26.479153Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-10T21:42:38.187634Z","title":"8-bit optimizers via block-wise quantization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.187634Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:6a5fdf3f55b0f248ec3cd51fce567f216bf0bdae71b2f924d343337ca82401e1","observation_id":"a4623ac3-e50c-431e-8457-f0b7523e542d","resolution":{"observed_at":"2026-08-10T21:42:38.187634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.191520Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.191520Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:c329d5ca0223858cd4f1b0f5f6ceba67ecc5e5f297309bbe897ea490bf512995","observation_id":"e42ab56d-3118-4ed5-8023-88c78fc161a3","resolution":{"observed_at":"2026-08-10T21:42:38.191520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.509125Z","title":"GPT-NeoX-20B: An open-source autoregressive language model,","venue":null,"work_id":"1b6f1d72-f18f-4273-9432-c85f99e380b9","year":2022},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.195131Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:ce67cf5657768a053f3d5452c7c31dc2217c1c9b20422ec4f8d5de063ce5ff47","observation_id":"b26f6e6b-5293-47ed-8b43-ed9f35407131","resolution":{"observed_at":"2026-08-10T21:42:38.515169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.198731Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.198731Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:89a1f285bb99e46b3e934e598aff2d98098685a73ccbc9b038a501ccf311ce59","observation_id":"bfdced74-66cc-4749-82cc-914fa6cd931a","resolution":{"observed_at":"2026-08-10T21:42:38.198731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-10T21:42:38.202557Z","title":"Rwkv: Reinventing rnns for the transformer era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.202557Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:9adb378b519a9f74af06225c054107184ce651041d3e2c3102c97c89facaeb97","observation_id":"fa9efb2b-2a5e-4b36-a55e-8d563f5b3058","resolution":{"observed_at":"2026-08-10T21:42:38.202557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.206521Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.206521Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:8eafaaf30a73ec4f0d2add959e2414c877f08f2405cdad3c7716c858c59c98af","observation_id":"71fdde9f-5416-476f-9f80-77c0ee2a3147","resolution":{"observed_at":"2026-08-10T21:42:38.206521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.482541Z","title":"Mics: Near-linear scaling for training gigantic model on public cloud,","venue":null,"work_id":"e5f9ef75-7904-49ea-82a4-51f1d528e32f","year":2022},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.214329Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:fbfe5f173654f40f2716c8e4f44f60f3f10553bc6a24c233156520bb39fd0055","observation_id":"960dfec8-e83b-4ee4-8161-11a0675d1929","resolution":{"observed_at":"2026-08-10T21:42:38.487222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15627","last_updated":"2024-02-23T22:10:59Z","snapshot_observed_at":"2026-08-20T04:50:06.499258Z","submitted_at":"2024-02-23T22:10:59Z","title":"MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15627","snapshot_observed_at":"2026-08-10T21:42:38.218267Z","title":"Megascale: Scaling large language model training to more than 10,000 gpus,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.218267Z"},"links":{"cited_paper":"/paper/2402.15627","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:35007f41c81712d1c2337052c2197465dcfbddd3f8f7daa9a244336f50aa8b73","observation_id":"432033b2-76e4-4c6b-839f-cbbce1021da7","resolution":{"observed_at":"2026-08-10T21:42:38.218267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-10T21:42:38.210400Z","title":"Available: https://arxiv.org/abs/2304.11277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.210400Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:45145ccf9e4982ddfc15bf9b1499755179e24ce19cae071f7f6728afab7f06f9","observation_id":"2b629f5e-1470-412e-a753-13dd96880d73","resolution":{"observed_at":"2026-08-10T21:42:38.210400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12705","last_updated":"2023-12-21T22:06:04Z","snapshot_observed_at":"2026-08-21T23:52:27.102226Z","submitted_at":"2023-12-20T02:03:15Z","title":"Optimizing Distributed Training on Frontier for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12705","snapshot_observed_at":"2026-08-10T21:42:38.225511Z","title":"Optimizing distributed training on frontier for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.225511Z"},"links":{"cited_paper":"/paper/2312.12705","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:6a8969dce16612e5aa9c85b76bf6147506d9b06ce12656f7292a4ae9a06bf49b","observation_id":"12f5fa30-71b4-4dd6-8ae2-27c76559ba6e","resolution":{"observed_at":"2026-08-10T21:42:38.225511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00691","last_updated":"2024-02-01T15:50:37Z","snapshot_observed_at":"2026-08-16T14:22:28.048117Z","submitted_at":"2024-02-01T15:50:37Z","title":"Comparative Study of Large Language Model Architectures on Frontier","version":1},"cited_work":{"arxiv_id":"2402.00691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.00691","snapshot_observed_at":"2026-08-10T21:42:38.279661Z","title":"Comparative Study of Large Language Model Architectures on Frontier","venue":"cs.DC","work_id":"e800da22-632b-4164-b98e-3fa2a5af1f2b","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.229469Z"},"links":{"cited_paper":"/paper/2402.00691","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:d24c333f652cc40ef6f92305703c980965efc42d56fcdc291c99f634b8afefeb","observation_id":"5e608e03-f496-4b9a-8945-d3c111500d6a","resolution":{"observed_at":"2026-08-10T21:42:38.286343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.468663Z","title":"Accelerating large language model training with hybrid gpu-based compression,","venue":null,"work_id":"7e5826b4-4048-4236-9bbb-b1523f53005b","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.222134Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:0d8c53e0c08f13fadc325a9ba41812b82f2bf03d89685475c3df93163b736945","observation_id":"75297a7e-1ce8-4d1a-8f66-b58553ba9c54","resolution":{"observed_at":"2026-08-10T21:42:38.472809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2024","last_updated":"2014-06-08T20:52:15Z","snapshot_observed_at":"2026-08-14T23:31:08.719247Z","submitted_at":"2014-06-08T20:52:15Z","title":"Hilfer fractional advection-diffusion equations with power-law initial condition; a Numerical study using variational iteration method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2024","snapshot_observed_at":"2026-08-10T21:42:38.233849Z","title":"Democratizing ai: Open-source scalable llm training on gpu-based supercomputers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.233849Z"},"links":{"cited_paper":"/paper/1406.2024","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:a47f966b2c53b2f8ce2b5f940ab8abd44ff6803a9ceaf775b19a037d26b2e3ad","observation_id":"70cee47f-4482-4411-b2cf-e42347847ace","resolution":{"observed_at":"2026-08-10T21:42:38.233849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T21:42:38.119113Z","title":"Available: https://arxiv.org/abs/2009.03300","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.119113Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:3be42b243248b19f198795b4d99b953f2e908432bb54f542aa632331679b23ec","observation_id":"c3c524c6-630f-477b-b15e-2c946f85c94a","resolution":{"observed_at":"2026-08-10T21:42:38.119113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2501.04266."}